Text to video with audio
Grok Imagine Video 1.5 Text to Video, utviklet av xAI, forvandler skriftlige beskrivelser til korte videoklipp komplett med lyd, alt fra en enkelt tekstprompt. Du beskriver scenen du vil ha, og modellen genererer et bevegelig klipp med lyd som matcher ordene dine. Det er ingen referansebilder eller opptak som må leveres først. Du skriver bare, og modellen tar seg av resten, noe som gjør det til en av de mest direkte måtene å gå fra en idé i hodet ditt til et ferdig klipp på skjermen.
I hjertet av denne modellen ligger prompt-drevet historiefortelling. Din tekstbeskrivelse kan være opptil en generøs lengde, noe som gir deg rom til å beskrive karakterer, omgivelser, belysning, stemning, bevegelse og stil i så mye detalj som du liker. Et eksempel på prompt viser den typen uttrykksfull rekkevidde modellen responderer på: "Anime schoolgirl bursting out of house door, cherry blossoms blowing, morning light, speed lines indicating rush, chibi-ready expressions, classic shojo aesthetic, vibrant colors." Den ene setningen pakker inn karakter, handling, miljø, belysning og en svært spesifikk visuell stil, og modellen jobber for å bringe alle disse elementene sammen til et sammenhengende animert klipp.
En av modellens fremtredende funksjoner er at den genererer lyd sammen med det visuelle. I stedet for å produsere et stille klipp som du må score eller designe lyd for separat, leverer den video med lyd integrert fra starten. Modellen er rettet mot stilisert output, transformasjon og lipsync, noe som peker på dens komfort med uttrykksfulle, karakterdrevne scener der munn, uttrykk og bevegelse må føles koblet til det som skjer på skjermen.
Du har reell kontroll over formen og lengden på outputen din. Varighet er justerbar, slik at du kan produsere alt fra et raskt ettsekunds beat helt opp til et femtsekunds klipp, så du kan matche lengden til det du lager, enten det er en snappy sosial loop eller et lengre narrativt øyeblikk. Standarden ligger på seks sekunder, en komfortabel lengde for de fleste kortformideer. Oppløsning kan settes til 480p, 720p eller 1080p, noe som gir deg valg mellom raskere, lettere utkast og skarpere, høyere detaljfinalerendere. Standarden på 720p slår en praktisk balanse mellom klarhet og effektivitet.
Støtte for aspektforhold er uvanlig bred. Du kan velge fra bredskjerm 16:9 for kinematisk og landskapsramming, høy 9:16 for vertikale mobil- og sosiale formater, kvadratisk 1:1 for feed-vennlige innlegg, og en rekke mellomvalg inkludert 4:3, 3:2, 2:3 og 3:4. Denne fleksibiliteten betyr at du kan generere et klipp som allerede er riktig rammet for destinasjonen, enten det er en horisontal trailer, en vertikal story eller en kvadratisert sosial flis, uten beskjæring eller omformatering etterpå.
Modellen outputter standard MP4-video, som spilles og deles lett på tvers av redigeringsverktøy, sosiale plattformer og presentasjonsprogramvare. Klipp rendres med 24 frames per second, en bildehastighet lenge assosiert med et filmisk, kinematisk utseende, og modellen produserer hele sekvensen av bilder som trengs for å fylle din valgte varighet.
Denne modellen passer naturlig for et bredt spekter av kreative profesjonelle. Animatører og illustratører kan lene seg på dens stilisert styrke for å bringe anime, chibi, shojo og andre illustrerte estetikk til live i bevegelse. Sosiale medie-skapere og markedsførere kan generere vertikale og kvadratiske klipp tilpasset deres plattformer uten ekstra omformatering. Filmmakere og storyboard-kunstnere kan raskt visualisere scener, stemninger og kamerenergi før de forplikter seg til full produksjon. Designere og innholds-team kan produsere korte branded øyeblikk, animerte konsepter og uttrykksfulle karakterklipp direkte fra en skriftlig brief. Fordi den bare trenger en prompt, senker den også barrieren for alle som har et sterkt visuelt bilde, men ikke opptak- eller tegnepipeline for å realisere det.
Å jobbe med modellen belønner beskrivende, lagdelt prompting. Jo klarere du navngir subjektet, handlingen, omgivelsene, belysningen og den visuelle stilen, desto mer trofast vil resultatet reflektere intensjonen din, som anime-eksempelet demonstrerer. Å stable spesifikke stilistiske hint, stemningsord og bevegelsesbeskrivelser gir modellen et rikere mål å sikte mot. Hvis du vil ha et stilisert eller transformativt utseende, hjelper det å si det eksplisitt, sammen med estetikken du er ute etter, å styre outputen i den retningen.
Noen praktiske hensyn er verdt å ha i mente. Klipp er korte som design, toppet ved femtsekunder, så denne modellen skinner for punchy, selvstendige øyeblikk snarere enn lange kontinuerlige scener. Høyere oppløsninger produserer mer detalj, men involverer naturlig mer arbeid å rendere, så en lettere innstilling kan være hendig for rask iterasjon og utkast før du forplikter deg til en polert 1080p-versjon. Fordi output genereres helt fra teksten din, kan det eksakte resultatet variere mellom kjøringene, noe som gjør iterasjon til en normal del av prosessen: raffiner ordlyden din, juster rammen og lengden, og generer på nytt til klippet lander som du forestilte deg. Med sin kombinasjon av lydinkludert generering, fleksibel ramming, justerbar lengde og en klar tilknytning til stilisert, uttrykksfullt innhold, er Grok Imagine Video 1.5 Text to Video et allsidig utgangspunkt for å forvandle skriftlige ideer til korte, lydførende klipp.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beskriv videoscenen din med bevegelse, kameravinkler og stemning
Modellen skaper filmatisk bevegelse med naturlig fysikk og lyssetting
Last ned og del den produksjonsklare videoen din
Viser aggressiv kamerakontroll med en umulig one-shot FPV-drone-bevegelse, som beviser modellens kommando over kontinuerlig bevegelse og dynamisk skala i bredskjerm.
Utnytter modellens realisme for falsk-bodycam-absurdistisk komedie med synkronisert dialog, et format designet for å gå viralt gjennom deadpan-autentisitet.
Demonstrerer presis kamerakontroll og temporær bevegelse med en akselererende hyperlapse og kontinuerlig lysspor-dynamikk, ideell for et kinematisk 16:9-heltklipp.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Bytt til resonneringsstyrt syntese i dag

Cinematic video from references
10 kreditter
Text to video with audio
0.7 kreditter

Fast balanced text-to-video generation
1.6 kreditter

Cinematic video with native audio
1.4 kreditter

Film-grade video with audio
0.1 kreditter

Frontier 2K text-to-video generation
7.3 kreditter

Fast cinematic video with audio
0.1 kreditter

Cinematic video from references
0.4 kreditter
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 kreditter