Video from image, audio references
Grok Imagine Video 1.5 Reference to Video, desarrollado por xAI, convierte tus imágenes de referencia y una pista de audio opcional en un vídeo totalmente animado. En lugar de partir de un solo fotograma, este modelo te permite introducir un conjunto de imágenes que guían tanto el aspecto como el contenido del clip final, combinándolas luego con un prompt de texto que describe el movimiento, ambiente y acción que deseas ver. El resultado es un vídeo breve que se inspira directamente en el mundo visual que le ofreces, siendo ideal para creadores que ya cuentan con ilustraciones, fotos, imágenes de producto o mood boards y quieren darles vida en movimiento.
La gran función aquí es la referencia múltiple de imágenes. Puedes aportar entre una y siete imágenes de referencia, y el modelo las utiliza como guías de estilo y contenido. En tu prompt, puedes señalar cada imagen individualmente, indicando exactamente cómo quieres que se relacionen, fusionen o hagan la transición. Esto hace posible describir escenas como "descubrir lugares y motion graphics geniales usando estas tres imágenes" y que el modelo las entrelace en una secuencia coherente. Ya sea para introducir un personaje, un fondo, una textura y una paleta de color, o tres variantes del mismo motivo, el modelo trata cada referencia como un bloque de construcción.
El audio también es un input de primera clase. Puedes adjuntar un único clip de audio de referencia y mencionarlo en tu prompt junto a las imágenes. Esto permite dar indicaciones como que una persona de una de tus imágenes hable con la voz del audio, sincronizando la interpretación hablada o el sonido con las imágenes proporcionadas. Como tanto imágenes como audio pueden etiquetarse directamente en el prompt, conservas un control preciso sobre cómo cada elemento contribuye al vídeo final.
Los vídeos se generan a 24 fotogramas por segundo y puedes elegir entre dos resoluciones: una opción ligera de 480p para pruebas rápidas y borradores, y una opción más nítida de 720p para resultados más pulidos. La duración es flexible, desde solo un segundo hasta un máximo de quince segundos, para que puedas crear desde pequeños loops hasta escenas más largas. El ejemplo de salida muestra un clip completo a 1280x720 de poco más de diez segundos a 24fps, dando una idea de la suavidad y la duración que el modelo puede conseguir en una sola generación.
La compatibilidad de relación de aspecto es amplia, admitiendo panorámica 16:9 para trabajos cinematográficos y de paisaje, vertical 9:16 para formatos sociales, cuadrado 1:1 para feeds y varias proporciones clásicas como 4:3, 3:2, 2:3 y 3:4. Este abanico te permite enfocar exactamente el encuadre que tu plataforma o proyecto requiere, sin necesidad de recortar después, ya sea para crear un corto vertical, un anuncio cuadrado o una escena panorámica.
Los controles creativos son sencillos. Tu prompt de texto es la clave, ya que describe el movimiento y la historia mientras señala tus imágenes de referencia y audio. Eliges cuántas imágenes de referencia usar y en qué orden, configuras la duración deseada, seleccionas la resolución y eliges la relación de aspecto. Los prompts pueden ser muy detallados, admitiendo descripciones extensas para que puedas precisar cómo deben combinarse las imágenes, qué debe moverse y cómo debería evolucionar la escena con el tiempo.
¿Quién se beneficia más? Cineastas y creadores de vídeo pueden prototipar escenas rápidamente introduciendo arte conceptual o fotos de localización y describiendo la acción. Diseñadores y artistas de motion graphics pueden animar composiciones estáticas y combinar varios recursos visuales en una sola pieza animada. Creadores de contenido para vídeo vertical pueden transformar varias imágenes en clips listos para publicar en el formato adecuado. Equipos de marketing y producto pueden animar imágenes fijas de productos con prompts descriptivos de movimiento. Cualquier persona que trabaje a partir de una biblioteca visual ya existente, en lugar de crear todo desde cero, encontrará el flujo basado en referencias especialmente eficiente al mantener fiel el vídeo resultante al aspecto que ya tiene.
Algunos aspectos prácticos a tener en cuenta: el modelo requiere al menos una imagen de referencia y un prompt de texto para funcionar, y admite un máximo de siete imágenes y un audio por generación. Como las imágenes actúan como guía de estilo y de contenido, elegir referencias limpias y bien compuestas que representen claramente lo que quieres en pantalla produce los resultados más predecibles. Etiquetar cada imagen explícitamente en el prompt te da el control más claro sobre la combinación. Este modelo está aprobado para uso comercial, lo que lo hace apto para trabajos de cliente y proyectos publicados. Como en cualquier servicio generativo, las solicitudes deben cumplir las condiciones de uso de xAI.
En resumen, Grok Imagine Video 1.5 Reference to Video está diseñado para creadores que desean que sus vídeos sean fieles a imágenes fuente concretas, añadiendo movimiento y, opcionalmente, voz o sonido. Combinando referencias múltiples, entrada de audio, duración flexible de hasta quince segundos, dos resoluciones y una gama completa de proporciones, te ofrece una forma enfocada y controlable de animar los recursos visuales que ya te importan.
Add the image that you want change
Añade una imagen opcional para guiar el aspecto, el personaje o el entorno
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Escribe un prompt: el modelo entiende la física, la iluminación y la intención emocional de tu escena
Haz clic para generar tu resultado final y descargar un vídeo de calidad profesional
Demuestra referencia de parallax con imágenes múltiples mientras la cámara cruza una puerta, el primer plano se desplaza más rápido que el fondo. Escenario arquitectónico cinematográfico 16:9.
Destaca la física causal: la lluvia comienza a mitad del clip, las gotas generan ondas en los charcos y oscurecen el pavimento en secuencia. Una amplia transformación atmosférica de cine.
Un cinemagraph perfecto para bucles donde el vapor se arremolina y los reflejos de neón brillan mientras el resto permanece estático. Ideal para ambientes panorámicos y loops infinitos.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
Pásate hoy a la síntesis guiada por razonamiento

Animate images into video with audio
10 créditos

Cinematic video from images
10 créditos

Multimodal references to video
10 créditos

Cinematic video from images fast
0.1 créditos

Animate image to 1080p video
2.8 créditos
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 créditos

Animate images into cinematic video
0.6 créditos

Animate images into 2K video
7.8 créditos