ShortGenius
Te presentamos Gemini Omni Flash

Gemini Omni Flash

Turn reference images into video with matching sound and motion

Multimodal references to video

SINCRO LABIAL EN RETRATO

ANIMACIÓN DE BELLEZA

RETRATO DE MODA

Gemini Omni Flash es un generador de vídeo multimodal que transforma tus imágenes de referencia y dirección creativa en vídeos cortos completos con audio. A diferencia de las herramientas que trabajan desde una sola fuente, este modelo está diseñado para fusionar múltiples tipos de entrada —texto, imágenes, audio y vídeo— para que puedas guiar el sujeto, el movimiento, el estilo y el sonido de tu clip final de una sola vez. Si puedes describir lo que quieres y proporcionarle el material de referencia adecuado, Omni Flash lo da vida como metraje en movimiento con una banda sonora integrada.

En su núcleo, el modelo toma un prompt escrito que describe la escena que quieres y una o más imágenes de referencia para anclar el aspecto visual. Podrías escribir algo tan simple como «Un gato jugueteando con un ovillo de lana en un salón iluminado por el sol» y proporcionar un par de imágenes para definir los personajes, el entorno o el estilo. El modelo entonces produce un vídeo que sigue tu descripción mientras se basa en la identidad visual de tus referencias. Puedes suministrar hasta diez imágenes de referencia, lo que te da mucho margen para establecer múltiples personajes, accesorios o elementos de escena en una sola generación.

Una de las características destacadas es la capacidad de vincular imágenes de referencia a roles específicos directamente dentro de tu prompt. En lugar de esperar que el modelo adivine qué imagen debe interpretar qué papel, puedes indicarle la referencia correcta en el momento adecuado de tu descripción. Esto te da un control creativo significativo sobre cómo contribuye cada imagen al plano final, algo útil cuando combinas varios sujetos distintos y quieres que cada uno aparezca como pretendes.

Dado que Omni Flash genera audio junto con las imágenes, es ideal para creadores que necesitan clips terminados y autónomos en lugar de metraje silencioso que requiera una pasada de sonido separada. El modelo incluye etiquetas para transformación estilizada y lip sync, lo que significa que está diseñado pensando en contenido expresivo, impulsado por personajes y estilizado. Esto lo hace perfecto para momentos de personajes animados, escenas de diálogo, cortos estilizados y cualquier proyecto donde importen el sonido y el movimiento sincronizados.

Tienes un control directo sobre la forma y la duración de tu salida. Los vídeos se pueden producir en formato panorámico 16:9, ideal para YouTube, presentaciones y piezas cinematográficas, o en formato vertical 9:16 adaptado a Reels, TikTok, Shorts y otras plataformas móviles. La duración del clip es ajustable de tres a diez segundos, con ocho segundos como valor predeterminado: suficiente para capturar un latido completo, una acción rápida o un momento hablado corto. Estas opciones te permiten adaptar la salida del modelo a la plataforma y al ritmo que exige tu proyecto sin necesidad de reformateo adicional.

¿Quién se beneficia más? Los creadores de redes sociales pueden generar clips verticales llamativos con sonido para sus feeds. Los animadores e ilustradores pueden ver cómo su arte estático cobra movimiento y habla, convirtiendo personajes inmóviles en performers. Cineastas y narradores pueden prototipar escenas y secuencias estilizadas rápidamente, usando imágenes de referencia para fijar el mundo visual antes de comprometerse con una producción completa. Diseñadores y marketers pueden producir fragmentos promocionales cortos y pulidos que combinen imágenes de marca con movimiento y audio. Dado que el modelo acepta una amplia gama de entradas, es lo suficientemente flexible para servir a muchos flujos de trabajo creativos diferentes.

El proceso es refrescantemente directo. Escribes tu prompt, adjuntas tus imágenes de referencia, eliges la relación de aspecto y la duración, y el modelo devuelve un archivo de vídeo listo para usar. Las capacidades de estilización y lip sync hacen que brille cuando quieres personajes que expresen emociones, se muevan y hablen en un estilo cohesivo, en lugar de metraje puramente fotorrealista. Proporcionar prompts claros y descriptivos junto con imágenes de referencia bien elegidas te ayudará a obtener los resultados más fieles, ya que el modelo se basa en ambos para entender tu intención.

Hay algunas consideraciones prácticas que vale la pena tener en cuenta. El modelo funciona en duraciones de formato corto —la longitud máxima del clip es de diez segundos—, por lo que está diseñado para momentos concisos en lugar de vídeo de larga duración. Si necesitas una pieza más larga, querrás planificar tu narrativa alrededor de una serie de clips cortos. La salida se limita a dos relaciones de aspecto, 16:9 y 9:16, que cubren la gran mayoría de casos de uso horizontales y verticales, pero no formatos cuadrados u otros inusuales. Y dado que se requiere al menos una imagen de referencia, se trata de una herramienta impulsada por imágenes: está diseñada para transformar y animar referencias visuales en lugar de generar una escena enteramente desde texto solo. Ese requisito es una fortaleza para creadores que ya tienen arte, personajes o imágenes de moodboard de las que partir, ya que mantiene la salida anclada a tu estilo visual establecido.

Con su combinación de entrada multimodal, audio integrado, encuadre flexible, lip sync y transformación estilizada, Gemini Omni Flash está dirigido a creadores que quieren pasar rápidamente de referencias a clips terminados con sonido. Elimina varios pasos de un flujo de trabajo de vídeo típico al manejar movimiento y sonido juntos, y su función de vinculación de roles te da un control fino sobre cómo aparece cada imagen de referencia en pantalla. Ya sea que estés produciendo una actuación estilizada de un personaje, un clip social rápido o una escena de prueba de concepto, el modelo convierte tus ideas e imágenes en vídeos cortos listos para compartir.

Genera con el modelo de vídeo más avanzado

Tu imagen

Add the image that you want change

Paso 1

Subir imagen

Añade una imagen opcional para guiar el aspecto, el personaje o el entorno

A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.

Paso 2

Escribe tu escenario

Escribe un prompt: el modelo entiende la física, la iluminación y la intención emocional de tu escena

Paso 3

Empieza a compartir

Haz clic para generar tu resultado final y descargar un vídeo de calidad profesional

Más allá del prompt: un nuevo nivel de control

CINEMATOGRAFÍA NATURAL

CINEMATOGRAFÍA NATURAL

Demuestra animación cinematográfica de paisajes con movimiento atmosférico y sonido ambiental natural generado para narrativas en formato panorámico.

MOVIMIENTO DE PRODUCTO

MOVIMIENTO DE PRODUCTO

Muestra animación premium de productos combinando imágenes de referencia con iluminación dinámica y sonido para reels comerciales de lujo.

Compara con modelos similares

Animate as a smooth 360-degree rotation on an invisible turntable. Rotate slowly and continuously, taking 6 seconds for full rotation. Light reflections should shift naturally across the metal case and crystal. Maintain consistent dramatic lighting throughout rotation. Add subtle sparkle on diamond indices as they catch light. Keep the background static and dark. Professional product video quality.

Por fin terminó la espera

Descubre la perfección con Gemini Omni Flash

Pásate hoy a la síntesis guiada por razonamiento

Preguntas frecuentes

Como mínimo, proporciona un prompt de texto que describa la escena que quieres y al menos una imagen de referencia. Puedes incluir hasta diez imágenes de referencia para definir múltiples personajes, accesorios o elementos de estilo, y opcionalmente elegir la relación de aspecto y la duración del clip.