Text to video with audio
LTX-2.3 22B förvandlar en enda skriftlig prompt till en färdig videoklipp komplett med eget synkroniserat ljud. Istället för att generera en tyst klipp och sedan leta efter ljudeffekter eller musik att lägga på efteråt beskriver du scenen du vill ha och modellen levererar rörliga bilder och matchande ljud tillsammans i ett svep. Det gör den till ett starkt val för filmskapare som bygger snabba previsualiseringar, innehållsskapare som producerar korta sociala klipp, motion designers som utforskar idéer och vilken konstnär som helst som vill se ett koncept röra sig och låta levande utan att röra en tidslinje.
I grunden läser modellen din textprompt och bygger en video från den. En bra prompt beskriver inte bara vad som visas på skärmen utan också hur det känns – till exempel „En cowboy som går genom en dammig stad mitt på ljusa dagen, kamera följer bakifrån, filmisk djup, realistisk belysning, westernstämning, 4K filmkorn.“ Ju mer du beskriver stämning, belysning, kamerarörelser och textur, desto närmare kommer resultatet det du föreställde dig. Modellen kan också utöka din prompt automatiskt och fylla i filmiska detaljer så att även en kortare beskrivning ger ett rikt, sammanhängande klipp.
Du har stor kontroll över klippets form och längd. Videor kan vara från ett kort 9-ramars ögonblick upp till 481 ramar, och du kan ställa in bildfrekvensen från 1 upp till 60 ramar per sekund, med 24 ramar per sekund – den klassiska filmkadensen – som standard. Standardklippet är 121 ramar i liggande 16:9-format, perfekt för bredbild och sociala videor, men du kan välja andra format för att passa ditt projekt. Uppspelningshastighet och längd samverkar, så fler ramar vid lägre bildfrekvens ger ett långsammare, mer utdraget ögonblick, medan högre bildfrekvens ger mjukare rörelse.
Ett av de mest iögonfallande kreativa verktygen är direkt kamerakontroll. Istället för att hoppas att modellen tolkar en fras som „zoom in på subjektet“ kan du välja bland verkliga kamerarörelser: dolly in, dolly out, dolly left, dolly right, jib up, jib down eller ett låst statiskt klipp. Dessa ger dig den typ av medveten, upprepningsbar kameraspråk som filmskapare förlitar sig på, och du kan justera rörelsens styrka upp eller ner för att få den subtil eller dramatisk. Det gör det mycket enklare att få avsiktlig rörelse som stöder din berättelse istället för slumpmässig drift.
Ljud genereras parallellt med videon som standard, och du kan stänga av det om du bara behöver tyst material. Du har också separata kreativa reglage för hur nära ljudet och videon följer din prompt respektive, och hur de balanserar mot varandra – användbart när du vill att ljudlandskapet ska kännas framträdande eller när du vill hålla fokus strikt på bilderna.
För att hjälpa till med övergripande sammanhang och fina detaljer använder modellen en multiskalig metod. Den skissar först videon i mindre skala och använder sedan den skissen för att vägleda en större, mer detaljerad slutrendering. Resultatet blir starkare konsistens och renare detaljer än vid generering i full storlek på ett svep. Du kan ytterligare finjustera hur nära modellen följer din prompt kontra hur mycket kreativ frihet den tar, justera raffineringsnivån för en balans mellan hastighet och polering, och använda ett kontrollerat variationsläge som kan höja kvaliteten på svåra scener.
En negativ prompt ger dig ett sätt att styra modellen bort från utseenden du inte vill ha. Som standard undviker den saker som tecknad film och TV-spelestetik, text på skärmen, vattenmärken, logotyper, undertexter, slow motion och statiska, platta klipp – vilket styr resultaten mot en mer filmisk, live action-känsla. Du kan skriva om den för att passa dina egna estetiska mål.
När det gäller utdata kan du exportera i flera format för att passa din arbetsflöde: standard MP4, WebM, ProRes för avancerade redigeringsarbetsflöden eller animerad GIF för lättviktigt delande. Kvalitetsnivåer sträcker sig från låg upp till maximal, och du kan vinkla filen mot snabbare skrivning, mindre storlek eller en balanserad medelnivå. Accelereringsinställningar låter dig byta mellan genereringshastighet och trohet beroende på om du itererar snabbt eller finaliserar ett hjälteklipp.
För reproducerbarhet kan du ange ett seed så att samma prompt och inställningar ger samma resultat – praktiskt när du vill göra små, kontrollerade ändringar istället för att börja om från scratch varje gång. En inbyggd säkerhetskontroll är aktiverad som standard.
LTX-2.3 22B passar bäst för kortformiga filmiska videor: stämningsbitar, konceptklipp, sociala klipp, animatics och idéskapande där synkroniserat ljud som är inbakat sparar ett helt redigeringssteg. Eftersom klipp mäts i ramar och genereras som självständiga ögonblick skiner den i enstaka suggestiva shots snarare än långa, flerscenernas berättelser. Att få ut det mesta handlar om att skriva beskrivande, filmiska prompts, välja en avsiktlig kamerarörelse och låta multiskalig rendering och raffinering göra sitt. Med kombinationen av promptdriven video, inbyggt ljud och precis kamerakontroll ger den skapare en snabb väg från en skriftlig idé till en rörlig, ljudsatt scen.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beskriv din videoscen med rörelse, kameravinklar och stämning
Modellen skapar filmisk rörelse med naturlig fysik och ljussättning
Ladda ner och dela din produktionsfärdiga video
Visar ihållande spårning, fordonspysik och motorgenererat ljud i en bredbildsfilmisk sekvens för YouTube och film.
Demonstrerar atmosfärisk dimmdynamik, belysningsövergångar och immersivt naturljud för Netflix-stil landskapsdokumentärer.
Framhäver modellens synkroniserade ljud-bildgenerering med publikljud, dynamisk scenbelysning och energisk kamerarörelse för bredbildsfilm.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Byt till resonemangsstyrd syntes idag

Fast cinematic video with audio
0.1 krediter

Text to video with audio
0.3 krediter
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 krediter

Cinematic video with native audio
1.4 krediter

Film-grade video with audio
0.1 krediter

Fast balanced text-to-video generation
1.6 krediter

Cinematic video from references
10 krediter

Cinematic video from references
0.4 krediter

Frontier 2K text-to-video generation
7.3 krediter