Video from image, audio references
Grok Imagine Video 1.5 Reference to Video, desenvolupat per xAI, converteix les teves imatges de referència i una pista d'àudio opcional en un vídeo totalment animat. En lloc d'iniciar des d'un sol fotograma, aquest model et permet alimentar-lo amb un conjunt d'imatges que guien tant l'aparença com el contingut del clip final, i després les combina amb un prompt de text que descriu el moviment, l'ànim i l'acció que vols veure. El resultat és un vídeo curt que s'inspira directament del món visual que li proporciones, fet que el converteix en una opció ideal per a creadors que ja tenen obres d'art, fotos, imatges de productes o taulers de tendències i volen donar-los moviment.
La capacitat principal aquí és la referència multiimatge. Pots proporcionar entre una i set imatges de referència, i el model les utilitza juntes com a guies d'estil i contingut. Al teu prompt, fas referència a cada imatge individualment, indicant al model exactament com vols que les peces es relacionin, es barregin o transicionin. Això permet descriure escenes com «descobreix llocs i gràfics de moviment genials utilitzant aquestes tres imatges» i que el model les teixi en una seqüència coherent única. Tant si incorpores un personatge, un fons, una textura i una paleta de colors, com tres variacions del mateix subjecte, el model tracta cada referència com un bloc de construcció.
L'àudio també és una entrada de primera classe. Pots adjuntar un clip d'àudio de referència únic i fer-hi referència al teu prompt al costat de les imatges. Això obre la porta a prompts com fer que una persona d'una de les teves imatges parli amb la veu de la teva pista d'àudio, permetent-te sincronitzar actuacions parlades o sons amb les visuals que proporciones. Com que tant les imatges com l'àudio es poden etiquetar directament al prompt, mantens un control precís sobre com cada element contribueix al vídeo final.
Els vídeos de sortida es produeixen a 24 fotogrames per segon en dues resolucions a triar: una opció més lleugera de 480p per a proves ràpides i esborranys, i una opció més nítida de 720p per a resultats més polits. La durada és flexible, des d'un segon com a mínim fins a quinze segons, perquè puguis crear des d'un bucle ràpid fins a una escena més llarga. L'exemple de sortida demostra un clip complet de 1280x720 que dura una mica més de deu segons a 24fps, donant una idea de la longitud i suavitat que el model pot aconseguir en una sola generació.
El suport d'aspect ratio és ampli, cobrint 16:9 panoràmic per a treballs cinematogràfics i paisatges, 9:16 vertical per a formats socials verticals, 1:1 quadrat per a feeds, i diversos ratios clàssics com 4:3, 3:2, 2:3 i 3:4. Aquesta varietat et permet apuntar al marc exacte que requereix la teva plataforma o projecte sense retallar després, ja sigui per a un curt vertical, un anunci quadrat o una escena panoràmica.
Els controls creatius són senzills. El teu prompt de text fa el treball pesat, descrivint el moviment i la història mentre fas referència a les teves imatges i àudio. Triïs quantes imatges de referència incloure i en quin ordre, estableixes la durada desitjada, esculls la resolució i selecciones l'aspect ratio. Els prompts poden ser molt detallats, suportant una quantitat generosa de text perquè puguis ser tan específic com vulguis sobre com hauria de combinar-se les imatges, què ha de moure's i com ha d'evolucionar l'escena al llarg del temps.
Qui en beneficia més? Els cineastes i creadors de vídeo poden prototipar escenes ràpidament alimentant art conceptual o fotos de localitzacions i descrivint l'acció. Els dissenyadors i artistes de motion graphics poden animar composicions estàtiques i barrejar múltiples actius visuals en una sola peça en moviment. Els creadors de contingut de vídeo curt vertical poden convertir un grapat d'imatges en clips llestos per publicar en l'aspect ratio correcte. Els màrqueters i equips de producte poden donar vida a fotos estàtiques de productes amb prompts descriptius de moviment. Qualsevol que treballi a partir d'una biblioteca existent de visuals, en lloc d'iniciar des de zero, trobarà el flux de treball basat en referències especialment eficient perquè manté el vídeo final ancorat a l'aparença que ja té a mà.
Algunes consideracions pràctiques valen la pena tenir en compte. El model requereix almenys una imatge de referència i un prompt de text per executar-se, i accepta un màxim de set imatges i un clip d'àudio per generació. Com que les imatges actuen com a guies tant d'estil com de contingut, triar referències netes i ben compostes que representin clarament el que vols a pantalla produirà els resultats més previsibles. Etiquetar cada imatge explícitament al teu prompt et dona el control més clar sobre com es combinen. Aquest model està aprovat per a ús comercial, fet que el fa adequat per a treballs de clients i projectes publicats. Com amb qualsevol servei de generació, les sol·licituds han de complir els termes d'ús de xAI.
En resum, Grok Imagine Video 1.5 Reference to Video està dissenyat per a creadors que volen que els seus vídeos es mantinguin fidels a imatges font específiques mentre afegeixen moviment, i opcionalment veu o so. Combinant referències multiimatge, entrada d'àudio, durada flexible fins a quinze segons, dues resolucions i una àmplia gamma d'aspect ratios, et proporciona una manera enfocada i controlable d'animar les visuals que ja t'importen.
Add the image that you want change
Afegeix una imatge opcional per guiar l'estètica, el personatge o l'entorn
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Escriu una indicació: el model entén la física, la il·luminació i la intenció emocional de la teva escena
Fes clic per generar el resultat final i descarregar un vídeo de qualitat professional
Demostra paral·laxi de referència multiimatge mentre la càmera llisca per una porta amb el primer pla movent-se més ràpid que el fons. Exhibició arquitectònica cinematogràfica 16:9.
Ressalta física causal: la pluja comença a mitja clip, les gotes fan ondulacions a tolls i assoleixen el paviment en seqüència. Una transformació atmosfèrica àmplia cinematogràfica.
Un cinemagràfic amic dels bucles sense costures on el vapor s'enrotlla i els reflexos de neó brillen mentre tot lo demás es manté congelat. Perfecte per a ambient paisatgístic en bucle infinit.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
Passa't avui a la síntesi guiada per raonament

Animate image to 1080p video
2.8 crèdits

Animate images into video with audio
10 crèdits

Animate images into cinematic video
0.6 crèdits

Cinematic video from images fast
0.1 crèdits

Cinematic video from images
10 crèdits

Animate images into 2K video
7.8 crèdits

Multimodal references to video
10 crèdits
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 crèdits