Cinematic video from references
Seedance 2 Reference to Video es el modelo de vídeo orientado por referencias más avanzado de ByteDance, creado para creadores que desean dirigir la generación utilizando material real de referencia en lugar de solo texto. En lugar de describir todo desde cero, puedes proporcionar al modelo una combinación de archivos de referencia: hasta 9 imágenes, 3 vídeos y 3 clips de audio (hasta 12 archivos en total entre todos los tipos), y combinarlos con una instrucción escrita. Indicas cada recurso directamente en tu prompt utilizando etiquetas simples como @Image1, @Video1 o @Audio1, para que el modelo sepa exactamente qué rostro, entorno, movimiento o sonido debe respetar. El resultado es un clip cinematográfico continuo, fiel a tus referencias y completando el mundo que las rodea.
La función más destacada es el audio nativo. En una sola pasada, el modelo genera sonido sincronizado junto con la imagen: ruidos ambientales, efectos de sonido, música e incluso diálogo sincronizado con los labios. No hay un paso aparte para añadir el sonido después. Así, una escena de multitud puede llegar ya con gritos superpuestos, clics de cámaras, sirenas lejanas y el motor al ralentí, todo perfectamente integrado y sincronizado con la acción. Puedes dejar la generación de audio activada para obtener un clip completamente finalizado, o desactivarla si prefieres encargarte del sonido tú mismo.
El control creativo es una de sus grandes fortalezas. Diriges la cámara mediante tu prompt usando lenguaje cinematográfico, solicitando dolly zooms, travellings, movimientos cámara en mano con micromovimiento natural, cambios de POV y perspectivas a ojo o elevadas. El modelo interpreta estas indicaciones como lo haría un director de fotografía. También simula la física realista: dinámica de fluidos, movimiento de telas y de personajes se comportan de forma creíble. Una capacidad especialmente útil es la edición multi-plano: en una sola generación de hasta 15 segundos, el modelo puede crear cortes naturales, obteniendo secuencias que fluyen entre tomas en vez de un solo plano fijo.
Al aceptar referencias visuales, el modelo destaca en la consistencia. Si proporcionas una imagen de referencia de un personaje, puede mantener ese mismo rostro y vestuario a lo largo de la escena, incluso al transformar el sujeto a un estilo visual diferente. Los ejemplos muestran una estética híbrida donde personajes animados 3D estilizados se integran perfectamente en un entorno de acción real fotorrealista, conservando siempre el mismo rostro y vestuario provenientes de la imagen de referencia, además de interactuar de forma creíble con la luz real, reflejos, destellos de farolas y sombras proyectadas. Esto lo convierte en una opción idónea para quienes necesitan un personaje recurrente, un producto específico, o una estética fija constante en toda una escena.
En cuanto a las opciones de salida, puedes generar a 480p para mayor rapidez, 720p para equilibrio en velocidad/calidad, o 1080p para la máxima calidad. La duración es flexible de 4 a 15 segundos, o puedes dejar que el modelo decida automáticamente según tu prompt. El aspecto de imagen también es adaptable: elige 16:9 para horizontal, 9:16 para vertical y redes sociales, 1:1 para formato cuadrado, 21:9 para ultra panorámico, 4:3, 3:4, o auto para que el modelo lo seleccione. Además, puedes solicitar una codificación de mayor calidad si deseas un archivo más grande y limpio, y fijar una semilla para reproducir un resultado que te haya gustado (pueden producirse pequeñas variaciones).
Las entradas de referencia tienen ciertos límites útiles a tener en cuenta. Las imágenes pueden ser JPEG, PNG o WebP de hasta 30 MB cada una, con un máximo de 9. Los vídeos pueden ser MP4 o MOV, con una duración total combinada de entre 2 y 15 segundos, un peso total inferior a 50 MB y cada vídeo entre 480p y 720p, permitiendo hasta 3 vídeos. El audio puede ser MP3 o WAV, hasta 3 clips con una duración total máxima de 15 segundos y 15 MB cada uno. Una regla importante: si proporcionas referencias de audio, debes incluir también al menos una imagen o vídeo de referencia. Y no importa cómo los combines: el número total de archivos de referencia de todos los tipos no puede superar los 12.
¿Quién se beneficia? Directores de cine y vídeo consiguen una forma de previsualizar o producir secuencias cortas cinematográficas con lenguaje de cámara real y sonido terminado. Creadores de contenido y productores de redes sociales pueden convertir una sola referencia de personaje en clips verticales consistentes. Publicistas y responsables de marketing pueden colocar la imagen de un producto en un entorno iluminado y estilizado con movimientos de cámara controlados. Animadores y artistas de medios mixtos pueden mezclar personajes estilizados en mundos fotorrealistas, justo el flujo híbrido que muestran los ejemplos. Al aprovechar tus propias imágenes, vídeos y audio, es ideal cuando la consistencia visual de marca, la identidad de personaje o una estética concreta importa más que la pura generación texto-a-vídeo.
Algunos consejos clave para obtener los mejores resultados. Redacta tus prompts como un director: describe el estilo, la iluminación y el entorno, el sujeto, la secuencia de acción y el audio deseado, nombrando explícitamente tus recursos con etiquetas @ para que el modelo sepa qué preservar. Mantén tus referencias de vídeo dentro de los límites de duración y resolución para asegurar que puedan integrarse limpiamente, y recuerda que al proporcionar audio debes incluir al menos una referencia visual que lo ancle. Para resultados más pulidos, céntrate en descripciones detalladas tanto de la acción como de la cámara, ya que el modelo responde especialmente bien a esa especificidad, como en el ejemplo de multitudes o convoy. Con referencias inteligentes y una dirección clara, Seedance 2 Reference to Video ofrece clips cinematográficos acabados, fieles al material que aportas y con sonido incluido.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Describe la escena de tu vídeo con movimiento, ángulos de cámara y ambiente
El modelo crea movimiento cinematográfico con física e iluminación naturales
Descarga y comparte tu vídeo listo para producción
Destaca el control de cámara de nivel director de Seedance 2 con movimientos complejos de cámara, simulaciones atmosféricas y paisajes dinámicos a gran escala, pensados para cinematografía panorámica de viajes.
Demuestra la capacidad de Seedance 2 para gestionar transiciones complejas de escenas, física estilizada (cristales rotos, escombros flotantes) y coreografías de iluminación dramática — mostrando su potencial narrativo tipo cut-scene para videoclips musicales.
Muestra el motor de física realista de Seedance 2 y la generación nativa de audio con diseño de sonido ambiental (nieve crujiente, viento, respiraciones) — logrando metraje documental de naturaleza de calidad Netflix, con movimiento animal preciso y dinámica atmosférica.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Pásate hoy a la síntesis guiada por razonamiento
Text to video with audio
0.7 créditos

Fast cinematic video with audio
0.1 créditos

Film-grade video with audio
0.1 créditos

Cinematic video from references
0.4 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Text to video with audio
0.3 créditos

Fast balanced text-to-video generation
1.6 créditos

Frontier 2K text-to-video generation
7.3 créditos

Cinematic video with native audio
1.4 créditos