Cinematic video from references
Seedance 2.0 Fast Reference to Video es el modelo de vídeo de referencia más avanzado de ByteDance, presentado en una versión rápida optimizada para obtener resultados ágiles sin sacrificar la creatividad. En lugar de crear un vídeo solo a partir de un prompt de texto, te permite alimentar el modelo con tu propio material de referencia y luego coreografiar cómo se combinan esos elementos en pantalla. Puedes combinar hasta nueve imágenes de referencia, hasta tres vídeos de referencia y hasta tres clips de audio en una sola generación, mezclando y combinando fuentes visuales y sonoras para dirigir el aspecto, el movimiento y el sonido del clip final.
Lo que distingue a este modelo es lo detalladamente que puedes referenciar tus materiales dentro del prompt. Cada imagen, vídeo y archivo de audio que subas recibe un identificador sencillo, así que puedes escribir @Image1, @Video2 o @Audio1 directamente en tu descripción para indicar al modelo exactamente qué fuente debe influir en cada momento o sujeto. Eso significa que no dependes simplemente de que el modelo capte un ambiente, sino que puedes nombrar el personaje de una imagen, el estilo de movimiento de un clip y la voz o ambiente de una pista de audio, describiendo cómo interactúan entre sí. Es un flujo de trabajo creado para transformar y estilizar material existente, traspasar personajes y estilos entre planos, y sincronizar la boca con el audio suministrado.
El modelo genera vídeos finales con audio sincronizado. Cuando la generación de audio está activada, produce efectos de sonido, ruido ambiental y diálogos sincronizados con el movimiento labial para que los personajes hablen acompasados con las palabras. Si prefieres utilizar tu propia banda sonora o voz, puedes aportar clips de audio de referencia y mencionarlos en tu prompt. Ten en cuenta que siempre que uses audio de referencia, deberás incluir al menos una imagen o vídeo de referencia para que el modelo pueda asociar el sonido a un elemento visual.
Tienes un control flexible sobre el encuadre. Elige entre una gama completa de proporciones de aspecto, desde 16:9 panorámico para horizontal, 9:16 vertical para contenido móvil, 1:1 cuadrado para redes sociales, 21:9 ultra panorámico para secuencias cinematográficas, además de 4:3 y 3:4, o deja que el modelo lo seleccione automáticamente según tu prompt. La duración también es adaptable: puedes generar clips de entre 4 y 15 segundos, o dejarla en automático para que se ajuste a la historia que describes. Esta flexibilidad facilita crear desde un loop rápido para redes sociales hasta una secuencia narrativa más larga.
En cuanto a calidad de salida, puedes elegir entre 480p para una generación más rápida y 720p para un resultado más equilibrado. También existe un control de calidad que te permite solicitar una versión de mayor calidad y tamaño de archivo cuando desees la imagen más limpia, o quedarte con la versión estándar para archivos más livianos. Estas opciones te permiten priorizar velocidad y peso de archivo o fidelidad, según si necesitas iterar ideas rápidamente o exportar una pieza final.
Los formatos admitidos son amplios y prácticos. Las imágenes de referencia pueden ser JPEG, PNG o WebP. Los vídeos de referencia pueden ser MP4 o MOV, y cada uno debe estar aproximadamente entre 480p y 720p de resolución, con una duración conjunta de entre 2 y 15 segundos. El audio de referencia puede ser MP3 o WAV, con un total de todos los clips que no supere los 15 segundos. En total puedes subir hasta doce elementos de referencia por generación, ofreciéndote una paleta rica y versátil y manteniendo la gestión sencilla para el modelo.
Este modelo es ideal para un amplio abanico de profesionales creativos. Realizadores y editores de vídeo pueden usarlo para estilizar y transformar metraje, extender una escena o mezclar varias tomas en una sola imagen cohesionada. Creadores de contenido y productores de redes sociales se benefician de las opciones de encuadre vertical y cuadrado, y duraciones cortas y dinámicas preparadas para feeds. Diseñadores de personajes y animadores pueden apoyarse en el sistema de referencias para mantener la coherencia de un personaje a lo largo del clip y sincronizar el movimiento labial con una voz suministrada. Músicos y narradores pueden emparejar una pista de audio con imágenes y dejar que el modelo alinee el movimiento con el sonido. Como puedes mencionar fuentes específicas por nombre en el prompt, el modelo recompensa las instrucciones claras y detalladas: si especificas exactamente cómo y cuándo intervenir cada referencia, tendrás mucho más control sobre el resultado.
Algunos puntos prácticos a tener en cuenta: el audio de referencia siempre requiere al menos una imagen o vídeo acompañando. Los vídeos deben estar dentro de los rangos de resolución y duración admitidos, y el audio total no puede superar los quince segundos. El número total de referencias (sumando imágenes, vídeos y audio) es de doce archivos, así que decide cuáles son esenciales en cada escena. Mayor resolución y calidad producen archivos más grandes y llamativos pero tardan más, mientras que 480p y la versión estándar son ideales para experimentar rápido. Como en toda generación basada en referencias, los resultados mejoran cuando tus materiales son limpios, bien iluminados y con buen encuadre, y cuando tu prompt nombra cada referencia de forma explícita, describiendo el movimiento, la ambientación y el sonido deseados. Usado de este modo, Seedance 2.0 Fast Reference to Video es una herramienta flexible para transformar tus propias imágenes, clips y audio en vídeos breves y sincronizados con tu dirección personal.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Describe la escena de tu vídeo con movimiento, ángulos de cámara y ambiente
El modelo crea movimiento cinematográfico con física e iluminación naturales
Descarga y comparte tu vídeo listo para producción
Muestra la simulación física realista y las dinámicas atmosféricas del modelo: sistemas meteorológicos creíbles, movimiento animal y transformaciones ambientales con calidad cinematográfica tipo Netflix y audio nativo.
Demuestra la precisión de Seedance 2.0 con física de objetos, dinámica de líquidos, detalle macro y transiciones perfectamente estilizadas: ideal para publicidad de producto de lujo con audio foley y ambiente sincronizado.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Pásate hoy a la síntesis guiada por razonamiento

Cinematic video from references
10 créditos

Fast cinematic video with audio
0.1 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Fast balanced text-to-video generation
1.6 créditos

Frontier 2K text-to-video generation
7.3 créditos

Text to video with audio
0.3 créditos
Text to video with audio
0.7 créditos

Film-grade video with audio
0.1 créditos

Cinematic video with native audio
1.4 créditos