Video from image, audio references
Grok Imagine Video 1.5 Reference to Video es un modelo de imagen a vídeo de xAI que convierte tus imágenes de referencia y un prompt escrito en clips de vídeo animados. En lugar de empezar de cero, alimentas al modelo con una o más imágenes de referencia y describes la escena que quieres, luego deja que genere movimiento que lleve el estilo y contenido de esas referencias hacia un vídeo terminado.
Lo que distingue a este modelo es cómo utiliza las referencias. Puedes proporcionar desde una hasta siete imágenes de referencia, y el modelo las trata como guías tanto para el estilo como para el contenido. En tu prompt, puedes referirte a imágenes específicas usando etiquetas simples como <IMAGE_0>, <IMAGE_1>, etc. Esto te permite escribir instrucciones como «La persona de <IMAGE_0> camina por una calle lluviosa iluminada por neón», para que el modelo sepa exactamente qué sujeto o elemento de estilo extraer de cada imagen. Ese sistema de etiquetado te da un control creativo preciso sobre cómo se combinan múltiples fuentes visuales en un solo plano, lo cual es especialmente útil cuando quieres que un personaje de una imagen aparezca dentro de un entorno o estilo tomado de otras.
El modelo está diseñado para trabajos estilizados y transformadores e incluye capacidad de lip-sync, lo que lo hace ideal para dar vida a personajes y retratos con movimiento expresivo y coordinado. Como acepta entradas de imagen, audio y texto, puedes superponer varios tipos de direcciones a la vez: imágenes para establecer el aspecto, texto para describir la acción y audio para guiar el timing y el movimiento de la boca. La salida es siempre un archivo de vídeo, listo para insertar en tu edición o compartir directamente.
Los profesionales creativos encontrarán mucha flexibilidad en cómo se enmarca y se paced el clip final. Puedes elegir entre una amplia gama de relaciones de aspecto, incluyendo 16:9 panorámica para visualización cinematográfica y de escritorio, 9:16 vertical para formatos sociales como reels y stories, 1:1 cuadrada para feeds, y varias opciones intermedias como 4:3, 3:2, 2:3 y 3:4. Esto significa que puedes generar vídeos adaptados exactamente a la plataforma o diseño que tengas en mente sin necesidad de recortar o reformatear después. La duración del vídeo también es ajustable, desde un solo segundo hasta quince segundos, para crear un bucle rápido, una escena corta o una secuencia más larga según tu proyecto.
Para la calidad de salida, el modelo ofrece dos opciones de resolución: 480p para clips más rápidos y ligeros, y 720p para un resultado más nítido y con mayor detalle. Los ejemplos de salida se ejecutan a 24 fotogramas por segundo, dando al movimiento un ritmo suave y cinematográfico. Un clip panorámico en 720p sale a 1280 por 720 píxeles, lo que funciona bien para la mayoría de contextos en línea y vistas previas.
¿Quién se beneficia más de este modelo? Artistas e ilustradores pueden animar su obra de arte existente o diseños de personajes, viendo cómo una pieza estática cobra movimiento y actúa. Los diseñadores pueden transformar tableros de referencia e imágenes de mood en piezas de concepto en movimiento. Cineastas y creadores de vídeo pueden prototipar planos combinando un sujeto con un entorno descrito, generando clips rápidos de previsualización antes de comprometerse con una producción completa. Creadores de contenido que trabajan en plataformas sociales pueden convertir imágenes de referencia en vídeos cortos y estilizados formateados precisamente para feeds verticales, cuadrados o panorámicos. Como se soporta lip-sync, cualquiera que produzca personajes parlantes, avatares animados o cortos narrados puede combinar un retrato con audio para crear clips de actuación sincronizados.
Los mejores resultados provienen de un prompting reflexivo. Dado que el modelo lee tanto tus imágenes de referencia como tu descripción de texto, describir la acción con claridad mientras etiquetas las imágenes correctas ayuda a que entienda exactamente qué debe moverse y cómo. Cuando uses múltiples referencias, asignar a cada una un rol en tu prompt, como una imagen para el personaje y otra para el entorno o estilo, mantiene la composición coherente. Recuerda que puedes combinar hasta siete imágenes, lo que te da espacio para construir escenas ricamente estratificadas, pero un conjunto enfocado de referencias con un prompt claro suele producir los resultados más limpios y controlables.
Hay algunas consideraciones prácticas que vale la pena tener en cuenta. Se requiere al menos una imagen de referencia y un prompt de texto para cada generación, ya que el modelo está diseñado para guiar su salida con referencias visuales en lugar de generar solo a partir de texto. La resolución máxima es 720p, por lo que este modelo está orientado a vídeos estilizados, transformadores y listos para redes sociales en lugar de acabados en gran formato y alta resolución. La duración del clip está limitada a quince segundos, lo que encaja bien con narrativas cortas, bucles y contenido social. Dentro de esos límites, la combinación de referenciación multiimagen, encuadre flexible, duración ajustable y lip-sync lo convierte en una herramienta versátil para convertir imágenes estáticas en movimiento expresivo.
En resumen, Grok Imagine Video 1.5 Reference to Video es una herramienta de animación impulsada por referencias que da a los creadores control directo sobre cómo sus imágenes se convierten en vídeo. Al permitirte etiquetar referencias específicas dentro de tu prompt, elegir entre un amplio conjunto de relaciones de aspecto, ajustar longitud y resolución, e incluso sincronizar el movimiento de la boca con audio, pone las decisiones creativas en tus manos mientras se encarga de la generación de movimiento por ti.
Add the image that you want change
Añade una imagen opcional para guiar el aspecto, el personaje o el entorno
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Escribe un prompt: el modelo entiende la física, la iluminación y la intención emocional de tu escena
Haz clic para generar tu resultado final y descargar un vídeo de calidad profesional
Demuestra paralaje de referencia multiimagen mientras la cámara se desliza por una puerta con el primer plano moviéndose más rápido que el fondo. Muestra arquitectónica cinematográfica en 16:9.
Resalta física causal: la lluvia comienza a mitad del clip, las gotas forman ondas en charcos y oscurecen el pavimento en secuencia. Una transformación atmosférica panorámica cinematográfica.
Un cinemagrafo apto para bucles seamless donde el vapor se enrosca y los reflejos de neón titilan mientras todo lo demás permanece congelado. Perfecto para ambientación de paisaje en bucle infinito.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
Pásate hoy a la síntesis guiada por razonamiento

Animate images into 2K video
7.8 créditos

Animate images into cinematic video
0.6 créditos

Animate image to 1080p video
2.8 créditos

Multimodal references to video
10 créditos

Cinematic video from images
10 créditos

Animate images into video with audio
10 créditos
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 créditos

Cinematic video from images fast
0.1 créditos