ShortGenius
Te presentamos Gemini Omni Flash

Gemini Omni Flash

Blend reference images, audio, and text into video with matching sound

Multimodal references to video

LIP-SYNC EN RETRATO

ANIMACIÓN DE BELLEZA

RETRATO DE MODA

Gemini Omni Flash es un generador de vídeo multimodal que convierte tu material de referencia en vídeos cortos completos con audio sincronizado. Lo que lo distingue es la cantidad de tipos de entrada que puede combinar a la vez: puedes proporcionarle texto describiendo lo que quieres, imágenes de referencia para fijar los sujetos y el aspecto, más indicaciones de audio y vídeo para guiar el movimiento, el estilo y el sonido. A partir de estas referencias combinadas, el modelo produce un clip de vídeo terminado con sonido integrado — no una animación silenciosa que tengas que musicalizar después.

En esencia, Gemini Omni Flash funciona tomando un prompt escrito junto con una o más imágenes de referencia y generando un vídeo que respeta ambos. El texto le indica al modelo la historia, la acción y el estado de ánimo que buscas — algo como un gato jugando con un ovillo de lana en un salón soleado —, mientras que tus imágenes de referencia anclan los sujetos reales, personajes o estética que quieres ver en pantalla. Como el modelo acepta hasta diez imágenes de referencia, puedes proporcionar múltiples anclas visuales e incluso asignar a cada una un rol específico en tu escena usando etiquetas en línea en tu prompt, de modo que una imagen concreta se convierta en un personaje o elemento particular en el plano final. Esto te da un control significativo sobre exactamente quién y qué aparece, en lugar de dejarlo al azar.

El modelo está diseñado para creadores que quieren más que una imagen en movimiento. Como genera audio junto con el vídeo, es ideal para trabajos en los que el sonido y el movimiento deben sentirse conectados — las transformaciones estilizadas y la sincronización labial son algunas de sus fortalezas. Esto lo hace perfecto para clips centrados en personajes, escenas de diálogo expresivas, reinterpretaciones estilizadas de tus imágenes de origen y momentos narrativos cortos donde el sonido debe alinearse con lo que ocurre en pantalla.

¿Quién se beneficia? Los creadores de redes sociales pueden convertir fotos de referencia en clips cortos atractivos con audio ya incluido, listos para publicar. Cineastas y animadores pueden prototipar escenas y probar cómo se mueve y suena un personaje o un escenario antes de comprometerse con una producción completa. Diseñadores y marketers pueden transformar fotos de productos o imágenes de marca en piezas de movimiento estilizadas. Cualquiera que trabaje en contenido de sincronización labial — desde personajes animados hasta avatares expresivos — puede apoyarse en la capacidad del modelo para alinear el movimiento de la boca con el habla. Y como guías la salida con prompts en lenguaje natural más tus propias imágenes, no necesitas formación técnica para obtener resultados que reflejen tu intención creativa.

En cuanto a formatos y salida, Gemini Omni Flash te ofrece dos orientaciones: un marco panorámico 16:9 para visualización cinematográfica y de escritorio, y un marco vertical alto 9:16 diseñado para móviles y plataformas sociales de formato corto. Los vídeos duran ocho segundos por defecto y se pueden ajustar de tres a diez segundos, para que puedas configurar un bucle rápido o un ritmo ligeramente más largo según las necesidades de tu proyecto. Los vídeos se generan en 720p, ofreciéndote una resolución limpia y compartible para la mayoría de usos en línea. Cada generación se entrega como un archivo de vídeo descargable con sonido incluido.

En términos de controles creativos, tienes varias palancas. Tu prompt de texto es el volante principal — describe el sujeto, la acción, el escenario, el estado de ánimo y el sonido que quieres. El campo del prompt es generoso, dándote mucho espacio para escribir indicaciones detalladas y descriptivas en lugar de unas pocas palabras clave. Tus imágenes de referencia controlan la identidad visual de la escena, y la capacidad de vincular imágenes específicas a roles concretos significa que puedes ser preciso sobre qué referencia se convierte en qué elemento. La configuración de la relación de aspecto te permite adaptar la salida a su destino, y la configuración de duración te permite controlar el ritmo y la longitud. Juntos, estos elementos te ofrecen un flujo de trabajo que parte de tus propios recursos y termina en un vídeo que luce y suena como tú querías.

El hecho de que el modelo acepte audio y vídeo como entradas — no solo texto e imágenes fijas — es clave para su flexibilidad. Puedes incorporar sonido y material de vídeo existente para guiar cómo se mueve el clip final y cómo suena, lo que abre la puerta a trabajos de transformación: reimaginando material existente en un nuevo estilo mientras mantienes los elementos que te importan. Este enfoque multimodal es la característica definitoria del modelo y la razón por la que se agrupa con flujos de trabajo de transformación estilizada y sincronización labial.

Algunas consideraciones prácticas. Los clips son cortos por diseño — la ventana de tres a diez segundos hace que el modelo sea ideal para publicaciones en redes sociales, bucles, intros, momentos de reacción y pruebas rápidas de escenas en lugar de secuencias largas. Obtendrás los mejores resultados escribiendo prompts claros y específicos, y eligiendo imágenes de referencia que representen claramente los sujetos y el estilo que quieres, ya que esas imágenes hacen el trabajo pesado en la identidad visual. Cuando trabajes con múltiples referencias, aprovechar las etiquetas de vinculación de roles ayuda al modelo a entender exactamente cómo usar cada imagen. Y como se requiere al menos una imagen de referencia junto con tu prompt, esta es una herramienta impulsada por referencias — brilla cuando ya tienes material visual del que partir en lugar de empezar de cero.

En resumen, Gemini Omni Flash es un modelo de referencia a vídeo que combina texto, imágenes, audio y vídeo en clips cortos con sonido sincronizado, ofrece control sobre sujeto, movimiento, estilo y audio, soporta tanto formato panorámico como vertical, y te permite establecer la longitud del clip de tres a diez segundos. Es una opción potente para creadores que quieren transformar sus propias imágenes en vídeo estilizado con sonido y para cualquiera que trabaje en contenido corto de sincronización labial y centrado en personajes.

Genera con el modelo de vídeo más avanzado

Tu imagen

Add the image that you want change

Paso 1

Subir imagen

Añade una imagen opcional para guiar el aspecto, el personaje o el entorno

A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.

Paso 2

Escribe tu escenario

Escribe un prompt: el modelo entiende la física, la iluminación y la intención emocional de tu escena

Paso 3

Empieza a compartir

Haz clic para generar tu resultado final y descargar un vídeo de calidad profesional

Más allá del prompt: un nuevo nivel de control

CINEMATOGRAFÍA NATURAL

CINEMATOGRAFÍA NATURAL

Demuestra animación cinematográfica de paisajes con movimiento atmosférico y sonido ambiental natural generado para narración en formato panorámico.

MOVIMIENTO DE PRODUCTO

MOVIMIENTO DE PRODUCTO

Muestra animación premium de productos combinando imágenes de referencia con iluminación dinámica y sonido para reels comerciales de lujo.

Compara con modelos similares

Animate as a smooth 360-degree rotation on an invisible turntable. Rotate slowly and continuously, taking 6 seconds for full rotation. Light reflections should shift naturally across the metal case and crystal. Maintain consistent dramatic lighting throughout rotation. Add subtle sparkle on diamond indices as they catch light. Keep the background static and dark. Professional product video quality.

Por fin terminó la espera

Descubre la perfección con Gemini Omni Flash

Pásate hoy a la síntesis guiada por razonamiento

Preguntas frecuentes

Puedes combinar texto, imágenes de referencia, audio y vídeo a la vez. Tu prompt escrito describe la acción y el estado de ánimo, tus imágenes fijan los sujetos y el aspecto, y las indicaciones de audio y vídeo ayudan a guiar el movimiento y el sonido en el clip final.