Text to video with audio
Grok Imagine Video 1.5 (Text to Video), udviklet af xAI, forvandler skrevne prompts til korte videoklip med fuld lyd. I stedet for at sammensætte separate værktøjer til visuelle elementer og lyd, beskriver du scenen, du ønsker, på naturligt sprog, og modellen producerer et færdigt klip med bevægelse og sin egen lydspor. Dette gør det til en hurtig, selvstændig måde for skabere at teste idéer, bygge socialt indhold og prototype animerede billeder uden kamera, skuespillere eller et redigeringsprogram.
Kernen i modellen læser en tekstbeskrivelse og fortolker både subjektet og måden, det skal bevæge sig på. En prompt som "En hvid killing jager en sommerfugl gennem en solbeskinnet have, blid kamerafølging, naturlig bevægelse, blødt eftermiddagsljus filtreret gennem bladene" giver modellen alt, hvad den behøver: subjektet, handlingen, kameratilværelsen og lysstemningen. Fordi den reagerer på denne type detaljerede, cinematiske instruktioner, kan du forme ikke kun hvad der vises på skærmen, men også hvordan kameraet opfører sig og hvordan lyset falder over scenen. Eksempelprompts viser også, at den håndterer stiliseret arbejde som anime og shojo-estetik med hastighedslinjer, kirseb-blomster, levende farver og expressive karakterer, så den bevæger sig behageligt mellem fotorealistiske og illustrerede udtryk.
Du styrer længden på hvert klip og vælger alt fra 1 til 15 sekunder. Kortere klip er ideelle til hurtige loops, reaktionsøjeblikke og sociale snippets, mens længere varigheder giver plads til en fuldere rytme eller et lille narrativt øjeblik. Standardlængden lander på ca. 6 sekunder, som passer til de fleste enkelt-shot-idéer. Output afspilles ved 24 frames per second, hvilket giver bevægelsen en glat, filmagtig rytme.
Opløsningen er justerbar på tværs af tre niveauer: 480p til hurtige udkast og grove tests, 720p som en solid daglig standard og 1080p, når du vil have det skarpeste, mest detaljerede resultat til et færdigt stykke. Dette lader dig iterere hurtigt ved lavere opløsning, mens du finjusterer din prompt, og derefter generere en ren endelig version i højere kvalitet, når du er tilfreds med retningen.
Billedformatet er fuldt fleksibelt med et bredt udvalg af former, der matcher, hvor dit video skal leve. Du kan producere klassisk bredskærm 16:9 til landskabsafspilning, højt 9:16 til vertikale formater som mobil-første feeds og stories, kvadratisk 1:1 til gitterposter og mellemliggende ratioer inklusive 4:3, 3:2, 2:3 og 3:4. Fordi du kan ramme vertikalt eller horisontalt fra samme prompt, passer modellen naturligt ind i multi-platform indholdsworkflows, hvor samme idé skal vises i flere formater.
Et af de fremtrædende features er indbygget lyd. I stedet for at levere et stille klip, som du derefter skal score eller foley separat, genererer Grok Imagine Video 1.5 video med et tilhørende lydspor på samme tid. Dette forvandler en tekstprompt til noget tættere på et færdigt øjeblik, som er særligt nyttigt til hurtige konceptstykker, stemningstests og socialt indhold, hvor lyd tilføjer stor effekt uden ekstra trin.
Prompt-feltet er generøst og accepterer lange, rigtigt detaljerede beskrivelser op til flere tusinde tegn. Denne plads belønner specifikation: du kan lagde subjekt, handling, kamerabevægelse, belysning, farvepalet, kunststil og stemning ind i ét gennemløb. Som sample-prompts demonstrerer, giver det at nævne detaljer som "blid kamerafølging," "blødt eftermiddagsljus," "hastighedslinjer der indikerer fart" eller en navngivet estetik modellen klar retning og producerer resultater tættere på din hensigt.
Denne model er et stærkt match til et bredt spektrum af kreative professionelle. Sociale medie-skabere og markedsførere kan hurtigt lave iøjnefaldende vertikale eller kvadratiske klip. Filminstruktører og animatører kan bruge den til at previsualisere shots, blokere kamerabevægelser og udforske looks, før de forpligter sig til fuld produktion. Illustratører og designere kan bringe stiliseret verdener til live med bevægelse og lyd. Konceptkunstnere og fortællere kan teste stemninger, pacing og visuelle idéer hurtigt og generere flere variationer til sammenligning. Fordi den er tekst-drevet og kræver ingen kildeoptagelser, sænker den barrieren for alle, der vil have animerede billeder, men ikke har udstyr eller budget til en traditionel optagelse.
Nogle praktiske overvejelser er værd at have i mente. Modellen arbejder udelukkende fra tekst uden billede- eller referenceinput, så alt genereres ud fra din skrevne beskrivelse alene. Dette holder processen enkel, men det betyder også, at klarhed og detaljer i din prompt gør det meste af det tunge løft; en vag prompt giver et mere generisk resultat end en omhyggeligt beskrevet en. Klip-længden er begrænset til 15 sekunder, så dette er et værktøj til kortformede øjeblikke og enkeltshots frem for lange kontinuerlige sekvenser, selvom du kan generere flere klip til at samle noget længere. Anmodninger er underlagt xAI's brugsbetingelser.
Samlet set er Grok Imagine Video 1.5 (Text to Video) en alsidig, selvstændig måde at gå fra en idé i ord til en kort, lydbærende video. Med justerbar varighed op til 15 sekunder, tre opløsningsniveauer op til 1080p, et fuldt spektrum af billedformater, glat 24fps-bevægelse og indbygget lyd giver den skabere et fleksibelt udgangspunkt til alt fra hurtige sociale eksperimenter til polerede konceptstykker.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beskriv din videoscene med bevægelse, kameravinkler og stemning
Modellen skaber filmisk bevægelse med naturlig fysik og lys
Download og del din produktionsklare video
Fremhæver aggressiv kamerakontrol med en umulig one-shot FPV-drone-bevægelse, der beviser modellens kommando over kontinuerlig bevægelse og dynamisk skala i bredskærm.
Udnytter modellens realisme til falsk-bodycam absurdistisk komedie med synkroniseret dialog, et format designet til at blive viralt gennem deadpan autenticitet.
Demonstrerer præcis kamerakontrol og temporal bevægelse med en accelererende hyperlapse og kontinuerlig lysspor-dynamik, ideel til et cinematisk 16:9 hero-klip.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Skift til ræsonnementsstyret syntese i dag
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 credits

Cinematic video from references
10 credits

Frontier 2K text-to-video generation
7.3 credits

Fast balanced text-to-video generation
1.6 credits

Film-grade video with audio
0.1 credits

Fast cinematic video with audio
0.1 credits

Cinematic video with native audio
1.4 credits

Cinematic video from references
0.4 credits
Text to video with audio
0.7 credits