Cinematic video from references
Seedance 2.0 Fast Reference to Video es el modelo de video basado en referencias más avanzado de ByteDance, ofrecido en una versión optimizada para resultados rápidos sin sacrificar el rango creativo. En lugar de generar un video solo a partir de un texto, te permite alimentar el modelo con tu propio material de referencia y luego coreografiar cómo esos elementos se unen en pantalla. Puedes combinar hasta nueve imágenes de referencia, hasta tres videos de referencia y hasta tres clips de audio en una sola generación, mezclando y combinando fuentes visuales y sonoras para controlar la apariencia, el movimiento y el sonido del clip final.
Lo que diferencia a este modelo es la forma directa en que puedes señalar tus referencias dentro del prompt. Cada imagen, video y archivo de audio que subas recibe un identificador simple, así puedes escribir cosas como @Image1, @Video2 o @Audio1 directamente en tu descripción para indicarle al modelo qué fuente debe influir en cada momento o elemento. Así, no solo esperas que el modelo capte una atmósfera; puedes nombrar el personaje de una imagen, el estilo de movimiento de un clip y la voz o ambiente de un audio, detallando cómo se relacionan. Es un flujo creado para transformar y estilizar material existente, mantener personajes y estilos entre escenas y sincronizar labios con audio proporcionado.
El modelo genera videos terminados con audio sincronizado. Cuando la generación de audio está activada, produce efectos de sonido, ruido ambiental y diálogos sincronizados que coinciden con la acción en pantalla, logrando que los sujetos hablen moviendo la boca al ritmo de sus palabras. Si prefieres usar tu propio audio o voz, puedes subir clips de audio de referencia y mencionarlos en tu prompt. Ten en cuenta que, cada vez que incluyas audio de referencia, también necesitas al menos una imagen o video de referencia para que el modelo tenga un ancla visual para el sonido.
Tienes control flexible sobre el encuadre. Escoge entre una variedad completa de relaciones de aspecto, incluyendo 16:9 horizontal para paisajes, 9:16 vertical para contenidos móviles, 1:1 cuadrado para redes sociales, 21:9 ultra ancho para secuencias cinematográficas, además de opciones 4:3 y 3:4, o deja que el modelo elija automáticamente según tu prompt. La duración también es adaptable: genera clips desde 4 hasta 15 segundos, o configúralo en automático para que el tiempo se ajuste a la historia que describes. Esta flexibilidad permite producir desde clips sociales breves y en loop hasta historias más largas.
Para la calidad del video, puedes elegir entre 480p para una generación más rápida y 720p para un resultado más equilibrado. También hay un control de calidad que permite solicitar una versión con mayor calidad y tamaño de archivo si buscas la imagen más limpia posible, o mantener la versión estándar para archivos más ligeros. Estos ajustes permiten intercambiar velocidad y tamaño a cambio de fidelidad, según si estás iterando ideas rápido o exportando una pieza final.
Los formatos de entrada son amplios y prácticos. Las imágenes pueden ser JPEG, PNG o WebP. Los videos pueden ser MP4 o MOV, y cada uno debe estar entre 480p y 720p de resolución, con la suma de tus clips entre 2 y 15 segundos. El audio de referencia puede ser MP3 o WAV, con un total de hasta 15 segundos entre todos los clips de audio. En total, puedes incluir hasta doce referencias combinadas en una sola generación, dándote una paleta rica para trabajar mientras mantienes el proceso manejable para el modelo.
Este modelo es ideal para una variedad de creativos profesionales. Cineastas y editores pueden utilizarlo para estilizar y transformar material, extender una escena o unir múltiples tomas en una sola secuencia. Creadores de contenido y productores para redes sociales aprovechan los encuadres verticales y cuadrados además de la duración breve y dinámica pensada para feeds. Diseñadores de personajes y animadores pueden apoyarse en el sistema de referencias para que un sujeto sea reconocible en todo el clip y para sincronizar labios con una voz proporcionada. Músicos y narradores sonoros pueden emparejar una pista con imágenes y dejar que el modelo sincronice el movimiento al audio. Como puedes llamar cada recurso por nombre en el prompt, el modelo recompensa las indicaciones claras y descriptivas: cuanto más expliques qué referencia hace qué y cómo se desarrolla la escena, mayor será tu control sobre el resultado.
Algunos aspectos prácticos a tener en cuenta: el audio de referencia siempre requiere al menos una imagen o video de referencia. Los videos deben cumplir con la resolución y duración soportadas, y el total del audio no debe superar los quince segundos. El límite general de referencias entre imágenes, videos y audio es de doce archivos, así que planifica qué recursos son clave para tu toma. Una mayor resolución y calidad producirán archivos más grandes y atractivos pero tardarán más en generarse, mientras que 480p y la versión estándar son ideales para iteraciones rápidas. Como en toda generación basada en referencias, los resultados mejoran si tu material fuente está bien iluminado, claro y con buen encuadre, y si tu prompt nombra cada referencia y describe el movimiento, la atmósfera y el sonido que buscas. Usado de esta forma, Seedance 2.0 Fast Reference to Video es una herramienta flexible para transformar tus propias imágenes, clips y audios en videos cortos y sincronizados con el sonido, con la estética que tú diriges.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Describe tu escena de video con movimiento, ángulos de cámara y ambiente
El modelo crea movimiento cinematográfico con física e iluminación naturales
Descarga y comparte tu video listo para publicar
Demuestra la simulación de física realista y atmósferas dinámicas del modelo — recreando sistemas climáticos convincentes, movimiento animal y contundentes transformaciones ambientales con lenguaje visual de nivel Netflix y audio nativo.
Muestra la precisión de Seedance 2.0 en física de objetos, dinámicas de líquidos, detalles macro y transiciones estilizadas perfectas — ideal para cine de productos de lujo con foley sincronizado y audio ambiental envolvente.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Cámbiate hoy a la síntesis guiada por razonamiento

Text to video with audio
0.3 créditos

Fast cinematic video with audio
0.1 créditos

Cinematic video with native audio
1.4 créditos

Fast balanced text-to-video generation
1.6 créditos

Frontier 2K text-to-video generation
7.3 créditos
Text to video with audio
0.7 créditos

Cinematic video from references
10 créditos

Film-grade video with audio
0.1 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos