Video from image, audio references
Grok Imagine Video 1.5 Reference to Video, utviklet av xAI, gjør om dine referansebilder og et valgfritt lydspor til fullt animerte videoer. I stedet for å starte fra én enkelt ramme, lar denne modellen deg gi den et sett med bilder som styrer både utseendet og innholdet i klippet, og kombinerer dem med en tekstprompt som beskriver bevegelsen, stemningen og handlingen du ønsker å se. Resultatet er en kort video som trekker direkte fra det visuelle universet du gir den, og er dermed ideell for skapere som allerede har illustrasjoner, bilder, produktfoto eller moodboards og ønsker å gi dem bevegelse.
Hovedfunksjonen her er referanser med flere bilder. Du kan bruke alt fra ett til syv referansebilder, og modellen bruker dem sammen som stil- og innholdsguider. I prompten peker du på hvert bilde individuelt og forteller modellen nøyaktig hvordan de skal kombineres, blandes eller ha overganger. Dette gjør det mulig å beskrive scener som «oppdag steder og kule motion graphics med disse tre bildene», og få modellen til å veve dem sammen til en helhetlig sekvens. Enten du bruker en karakter, en bakgrunn, en tekstur og en fargepalett, eller tre varianter av samme motiv, behandles hvert bilde som en byggestein.
Lyd er også en førsteklasses input. Du kan legge ved ett referanselydklipp og referere til det i prompten sammen med bildene. Dette åpner for prompts der for eksempel en person på ett av bildene kan snakke med stemmen fra lydklippet, slik at du kan synkronisere tale eller lyd med de visuelle elementene du velger. Fordi både bilder og lyd kan tagges direkte i prompten, har du full kontroll over hvordan hvert element bidrar til sluttvideoen.
Utgangsvideoene produseres med 24 bilder per sekund i to oppløsninger: en lett 480p for raske tester og utkast, og en skarpere 720p for mer polerte resultater. Lengden er fleksibel – fra ett sekund og opp til femten sekunder, slik at du kan lage alt fra raske looper til lengre scener. Eksempelet viser en hel 1280x720-video på litt over ti sekunder og gir en følelse av hvor jevn og lang videoen modellen kan generere i ett forsøk.
Støtte for bildeforhold er bred, inkludert bredformat 16:9 for filmatiske og landskapsprosjekter, høyt 9:16 for vertikale sosiale formater, kvadratisk 1:1 til feed-bruk, samt flere klassiske forhold som 4:3, 3:2, 2:3 og 3:4. Dette gjør at du kan målrette nøyaktig det utsnittet plattformen eller prosjektet ditt krever, uten etterbeskjæring – enten du lager en vertikal kortvideo, en kvadratisk annonse eller en widescreen-scene.
De kreative kontrollene er enkle. Tekstprompten din gjør hovedjobben ved å beskrive bevegelse og historie, og peker til dine referansebilder og lyd. Du velger hvor mange referansebilder som skal brukes og rekkefølgen, setter ønsket lengde, velger oppløsning og aspektforhold. Prompts kan være svært detaljerte og støtter mye tekst, slik at du kan være så spesifikk du vil om hvordan bildene kombineres, hva som skal bevege seg, og hvordan scenen skal utvikles over tid.
Hvem drar mest nytte av dette? Filmskapere og videoprodusenter kan prototype scener raskt ved å laste inn konseptkunst eller lokasjonsbilder og beskrive handlingen. Designere og motion graphics-artister kan animere statiske komposisjoner og blande flere visuelle elementer til én bevegelig helhet. Innholdsskapere som lager vertikalvideo for sosiale medier kan raskt gjøre flere bilder om til ferdige snutter i riktig format. Markedsførere og produktteam kan gi liv til stillbilder ved å bruke bevegelsesbeskrivelser i prompten. Alle som jobber med et eksisterende bildemateriale, i stedet for å starte fra scratch, vil oppleve at referansebasert arbeidsflyt er ekstra effektiv fordi sluttresultatet holder seg tro mot det utseendet man allerede har.
Noen praktiske hensyn: Modellen krever minst ett referansebilde og en tekstprompt for å kunne kjøres. Du kan bruke maks syv bilder og ett lydklipp per generering. Siden bildene styrer både stil og innhold, gir rene, godt komponerte referanser de mest forutsigbare resultatene. Å merke hvert bilde eksplisitt i prompten gir deg mest kontroll over hvordan de kombineres. Denne modellen er godkjent for kommersiell bruk og passer til kundepr o sjekter og publiserte produksjoner. Som med alle genereringstjenester må forespørsler overholde bruksvilkårene fra xAI.
Kort fortalt: Grok Imagine Video 1.5 Reference to Video er laget for skapere som vil at videoene deres skal matche spesifikke bildekilder, samtidig som de kan legge til bevegelse – og eventuelt lyd eller tale. Ved å kombinere referanse med flere bilder, lydinput, fleksibel lengde på opptil femten sekunder, to oppløsninger og et bredt utvalg av bildeforhold, får du en fokusert og kontrollerbar måte å animere det visuelle du allerede bryr deg om.
Add the image that you want change
Legg til et valgfritt bilde for å styre utseende, karakter eller miljø
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Skriv en prompt – modellen forstår fysikken, lyssettingen og den følelsesmessige intensjonen i scenen din
Klikk for å generere det endelige resultatet og laste ned en video i produksjonskvalitet
Viser parallellakseeffekt med referansebilder mens kameraet glir gjennom en døråpning og forgrunnen beveger seg raskere enn bakgrunnen. Filmisk 16:9-arkitekturvisning.
Fremhever kausal fysikk: regn starter midt i klippet, dråpene lager ringer i pyttene og gjør asfalten gradvis mørkere. En filmatisk, bred atmosfærisk endring.
En sømløs, loop-vennlig cinemagraf hvor damp snor seg og neonlys reflekteres mens resten av scenen står stille. Perfekt for uendelige, stemningsfulle landskaps-looper.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
Bytt til resonneringsstyrt syntese i dag

Cinematic video from images fast
0.1 kreditter

Cinematic video from images
10 kreditter

Animate images into cinematic video
0.6 kreditter

Animate image to 1080p video
2.8 kreditter
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 kreditter

Multimodal references to video
10 kreditter

Animate images into 2K video
7.8 kreditter

Animate images into video with audio
10 kreditter