Cinematic video from references
Seedance 2 Reference to Video es el modelo de video basado en referencias más avanzado de ByteDance, creado para creadores que quieren guiar la generación usando material real y no solo texto. En vez de describir todo desde cero, alimentas el modelo con una mezcla de archivos de referencia: hasta 9 imágenes, 3 videos y 3 audios (máximo 12 archivos entre todos los formatos) y los combinas con una indicación escrita. Señalas cada recurso directamente en tu prompt usando etiquetas simples como @Image1, @Video1 o @Audio1, así el modelo sabe exactamente qué rostro, ambiente, movimiento o sonido debe respetar. El resultado es un solo clip cinematográfico continuo que honra tus referencias y rellena el mundo a su alrededor.
La función más destacada es el audio nativo. En una sola generación, el modelo produce sonido sincronizado junto a la imagen: ruido ambiental, efectos de sonido, música e incluso diálogos sincronizados con labios. No hay que agregar el audio después. Eso significa que una escena de multitud puede generarse ya con gritos superpuestos, clics de cámara, sirenas lejanas y el motor de un auto al ralentí perfectamente sincronizados con la acción en pantalla. Puedes dejar la generación de audio activada para obtener un clip completamente terminado o apagarla si prefieres ocuparte del sonido aparte.
El control creativo es una gran fortaleza. Dirige la cámara en tu prompt usando lenguaje cinematográfico: pide dolly zooms, travellings, tomas en mano con microtemblores naturales, cambios de punto de vista y perspectivas a nivel de los ojos o elevadas. El modelo interpreta estas direcciones como lo haría un director de fotografía. También maneja física realista, así que los fluidos, telas y movimientos de personajes se ven creíbles. Una función útil es la edición multi-toma: dentro de una sola generación de hasta 15 segundos, el modelo puede crear cortes naturales, ofreciéndote secuencias que fluyen entre distintas tomas en vez de un solo encuadre fijo.
Al aceptar referencias de imagen, el modelo tiene un rendimiento excelente en consistencia. Dale una referencia de personaje y podrá mantener ese mismo rostro y vestimenta en toda la toma, incluso si el personaje cambia de estilo visual. En los ejemplos, se muestra cómo personajes 3D estilizados se integran perfectamente en ambientes 100% fotorrealistas, manteniendo siempre el rostro y el outfit de la imagen original, mientras interactúan de manera realista con luz rebotada, destellos de flash, faroles callejeros y sombras proyectadas. Es ideal para quienes necesitan un personaje recurrente, un producto específico o mantener una imagen fija confiable durante toda una escena.
Sobre salidas, puedes generar a 480p para resultados rápidos, 720p para balance entre velocidad y calidad, o 1080p para resultados de alta calidad. La duración es flexible, de 4 a 15 segundos, o puedes dejar que el modelo decida basado en tu prompt. La relación de aspecto también es adaptable: elige 16:9 para horizontal, 9:16 para vertical y redes sociales, 1:1 para formato cuadrado, 21:9 para ultra panorámico, 4:3, 3:4 o auto para que el modelo elija. Puedes solicitar una codificación de mayor calidad si quieres un archivo más grande y limpio, y fijar un seed para repetir un resultado que te guste, aunque podría haber ligeras variaciones.
Los límites de entrada son claros. Las imágenes pueden ser JPEG, PNG o WebP de hasta 30 MB cada una (máximo 9). Los videos pueden ser MP4 o MOV, con un total entre 2 y 15 segundos, menos de 50 MB en total, cada video entre 480p y 720p, máximo 3 videos. El audio puede ser MP3 o WAV, hasta 3 clips con un total máximo de 15 segundos y máximo 15 MB cada uno. Importante: si das referencias de audio, también debes incluir al menos una imagen o video de referencia. Y sin importar la combinación, el total de archivos de referencia no puede exceder 12.
¿Quién se beneficia? Cineastas y directores de video pueden previsualizar o crear secuencias cortas con lenguaje de cámara real y sonido finalizado. Creadores de contenido y productores para redes sociales pueden transformar una referencia de personaje en clips verticales consistentes. Publicistas y marketers pueden colocar un producto en ambientes iluminados y estilizados con movimiento de cámara controlado. Animadores y artistas de medios mixtos fusionan personajes estilizados en mundos fotorrealistas, justo como muestra el ejemplo de flujo híbrido. Como aprovecha tus propias imágenes, videos y audio, es ideal donde la consistencia de marca, la identidad de personajes o la imagen específica importan más que solo deducción de texto a video.
Algunas mejores prácticas salen naturalmente: Escribe tus prompts como director: describe el estilo, la luz y el ambiente, el sujeto, la acción y el audio que buscas, e incluye tus recursos explícitamente con etiquetas @ para que el modelo sepa qué preservar. Mantén tus videos dentro de los límites de duración y resolución para que sean válidos y recuerda que dar audio requiere mínimo una referencia visual. Para resultados pulidos, detállate en las descripciones de acciones y movimientos de cámara; el modelo responde muy bien a ese nivel de especificidad, como se ve en el ejemplo complejo de multitud y convoy. Con buenas referencias y dirección clara, Seedance 2 Reference to Video entrega clips cinematográficos terminados y con sonido, que honran exactamente el material que le aportas.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Describe tu escena de video con movimiento, ángulos de cámara y ambiente
El modelo crea movimiento cinematográfico con física e iluminación naturales
Descarga y comparte tu video listo para publicar
Resalta el control de cámara de Seedance 2 con movimientos complejos de varios pasos, simulación atmosférica de clima y dinámicas de paisaje dramáticas perfectas para viajes en formato panorámico.
Ejemplifica la capacidad de Seedance 2 para manejar transiciones complejas de escena, física estilizada (videoclip de vidrios rotos, escombros flotando) y coreografías de iluminación — mostrando su poder para secuencias narrativas en producción de videos musicales.
Muestra el motor físico realista y generación nativa de audio de Seedance 2 con diseño sonoro ambiental (nieve crujiente, viento, respiración), logrando videos tipo documental de naturaleza al nivel Netflix con movimientos animales precisos y atmósferas envolventes.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Cámbiate hoy a la síntesis guiada por razonamiento

Fast cinematic video with audio
0.1 créditos

Fast balanced text-to-video generation
1.6 créditos

Frontier 2K text-to-video generation
7.3 créditos
Text to video with audio
0.7 créditos

Cinematic video from references
0.4 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Film-grade video with audio
0.1 créditos

Cinematic video with native audio
1.4 créditos

Text to video with audio
0.3 créditos