Multimodal references to video
Gemini Omni Flash es un generador de video multimodal que convierte tu material de referencia en videos cortos completos con audio sincronizado. Lo que lo distingue es la cantidad de tipos de entrada que puede combinar a la vez: puedes proporcionarle texto que describa lo que quieres, imágenes de referencia para fijar los sujetos y el aspecto, más pistas de audio y video para dirigir el movimiento, estilo y sonido. De estas referencias combinadas, el modelo produce un clip de video terminado con sonido integrado — no una animación silenciosa que tengas que musicalizar después.
En esencia, Gemini Omni Flash funciona tomando un prompt escrito junto con una o más imágenes de referencia y generando un video que respeta ambos. El texto le indica al modelo la historia, acción y ambiente que buscas — algo como un gato jugando con un ovillo de lana en una sala iluminada por el sol — mientras que tus imágenes de referencia anclan los sujetos reales, personajes o estética que quieres ver en pantalla. Como el modelo acepta hasta diez imágenes de referencia, puedes proporcionar múltiples anclas visuales e incluso asignar a cada una un rol específico en tu escena usando etiquetas en línea en tu prompt, para que una imagen en particular se convierta en un personaje o elemento específico en el shot final. Esto te da un control significativo sobre exactamente quién y qué aparece, en lugar de dejarlo al azar.
El modelo está diseñado para creadores que quieren más que una imagen en movimiento. Como genera audio junto con el video, es ideal para trabajos donde el sonido y el movimiento deben sentirse conectados — las transformaciones estilizadas y la sincronización labial son de sus fortalezas. Esto lo hace perfecto para clips con personajes, escenas expresivas de diálogo, reinterpretaciones estilizadas de tus imágenes fuente y momentos narrativos cortos donde el sonido debe alinearse con lo que pasa en pantalla.
¿Quién se beneficia? Los creadores de redes sociales pueden convertir fotos de referencia en clips cortos atractivos con audio ya incluido, listos para publicar. Cineastas y animadores pueden prototipar escenas y probar cómo se mueve y suena un personaje o entorno antes de comprometerse con una producción completa. Diseñadores y marketers pueden transformar fotos de productos o imágenes de marca en piezas de movimiento estilizadas. Cualquiera que trabaje en contenido de sincronización labial — desde personajes animados hasta avatares expresivos — puede apoyarse en la capacidad del modelo para alinear el movimiento de la boca con el habla. Y como guías la salida con prompts en lenguaje natural más tus propias imágenes, no necesitas entrenamiento técnico para obtener resultados que reflejen tu intención creativa.
En cuanto a formatos y salida, Gemini Omni Flash te da dos opciones de orientación: un marco panorámico 16:9 para visualización cinematográfica y de escritorio, y un marco vertical alto 9:16 diseñado para móviles y plataformas sociales de formato corto. Los videos duran ocho segundos por defecto y se pueden configurar de tres a diez segundos, para que ajustes un loop rápido o un ritmo un poco más largo según las necesidades de tu proyecto. Los videos se generan en 720p, ofreciéndote una resolución limpia y compartible para la mayoría de usos en línea. Cada generación regresa como un archivo de video descargable con sonido incluido.
En términos de controles creativos, tienes varias palancas. Tu prompt de texto es el volante principal — describe el sujeto, la acción, el entorno, el ambiente y el sonido que quieres. El campo del prompt es generoso, dándote mucho espacio para escribir direcciones detalladas y descriptivas en lugar de solo unas palabras clave. Tus imágenes de referencia controlan la identidad visual de la escena, y la capacidad de vincular imágenes específicas a roles específicos significa que puedes ser preciso sobre qué referencia se convierte en qué elemento. La configuración de relación de aspecto te permite adaptar tu salida a su destino, y la configuración de duración te permite controlar el ritmo y la longitud. Juntos, estos crean un flujo de trabajo que parte de tus propios recursos y termina en un video que se ve y suena como lo imaginaste.
El hecho de que el modelo acepte audio y video como entradas — no solo texto e imágenes estáticas — es central para lo que lo hace flexible. Puedes incorporar sonido y material de video existente para guiar cómo se mueve el clip final y cómo suena, lo que abre la puerta a trabajos de estilo transformación: reimaginando material existente en un nuevo estilo mientras mantienes los elementos que te importan. Este enfoque multimodal es la característica definitoria del modelo y la razón por la que se agrupa con flujos de trabajo de transformación estilizada y sincronización labial.
Algunas consideraciones prácticas. Los clips son cortos por diseño — la ventana de tres a diez segundos hace que el modelo sea ideal para publicaciones sociales, loops, intros, momentos de reacción y pruebas rápidas de escenas en lugar de secuencias largas. Obtendrás los mejores resultados escribiendo prompts claros y específicos, y eligiendo imágenes de referencia que representen claramente los sujetos y estilo que quieres, ya que esas imágenes hacen el trabajo pesado en la identidad visual. Cuando trabajas con múltiples referencias, aprovechar las etiquetas de vinculación de roles ayuda al modelo a entender exactamente cómo usar cada imagen. Y como se requiere al menos una imagen de referencia junto con tu prompt, esta es una herramienta impulsada por referencias — brilla cuando ya tienes material visual del que partir en lugar de empezar de una página en blanco.
En resumen, Gemini Omni Flash es un modelo de referencia a video que combina texto, imágenes, audio y video en clips cortos con sonido sincronizado, ofrece control sobre sujeto, movimiento, estilo y audio, soporta tanto enmarcado panorámico como vertical, y te permite establecer la longitud del clip de tres a diez segundos. Es una gran opción para creadores que quieren transformar sus propias imágenes en video estilizado con sonido y para cualquiera que trabaje en contenido corto con sincronización labial y personajes.
Add the image that you want change
Agrega una imagen opcional para guiar el aspecto, el personaje o el entorno
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Escribe un prompt: el modelo entiende la física, la iluminación y la intención emocional de tu escena
Haz clic para generar tu resultado final y descargar un video de calidad profesional
Demuestra animación cinematográfica de paisajes con movimiento atmosférico y sonido ambiental de la naturaleza generado para narrativas en formato panorámico.
Muestra animación premium de productos combinando imágenes de referencia con iluminación dinámica y sonido para reels comerciales de lujo.
“Animate as a smooth 360-degree rotation on an invisible turntable. Rotate slowly and continuously, taking 6 seconds for full rotation. Light reflections should shift naturally across the metal case and crystal. Maintain consistent dramatic lighting throughout rotation. Add subtle sparkle on diamond indices as they catch light. Keep the background static and dark. Professional product video quality.”
Cámbiate hoy a la síntesis guiada por razonamiento

Cinematic video from images
10 créditos

Animate images into 2K video
7.8 créditos

Cinematic video from images fast
0.1 créditos

Animate images into cinematic video
0.6 créditos
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 créditos

Animate image to 1080p video
2.8 créditos

Animate images into video with audio
10 créditos

Video from image, audio references
0.4 créditos