Text to video with audio
LTX-2.3 22B converteix un únic prompt escrit en un clip de vídeo acabat complet amb el seu propi àudio sincronitzat. En lloc de generar un clip silenciós i després buscar efectes de so o música per superposar després, descrius l'escena que vols i el model lliura imatges en moviment i so coincident junts en un sol pas. Això el converteix en una opció ideal per a cineastes que construeixen previsualitzacions ràpides, creadors de contingut que produeixen clips socials curts, dissenyadors de moviment que exploren idees i qualsevol artista que vulgui veure un concepte moure's i sonar viu sense tocar una línia de temps.
Al seu nucli, el model llegeix el teu prompt de text i construeix un vídeo a partir d'ell. Un bon prompt descriu no només què apareix a la pantalla sinó com se sent — per exemple, «Un vaquer caminant per un poble polsós al migdia, càmera seguint des de darrere, profunditat cinematogràfica, il·luminació realista, ambient western, 4K film grain». Quant més descriguis ambient, il·luminació, comportament de la càmera i textura, més proper serà el resultat al que havies imaginat. El model també pot expandir el teu prompt automàticament, omplint detalls cinematogràfics perquè fins i tot una descripció més curta produeixi un pla ric i coherent.
Tens un ampli control sobre la forma i la longitud del teu clip. Els vídeos poden durar des d'un breu moment de 9 fotogrames fins a 481 fotogrames, i pots establir la freqüència d'imatges des de 1 fins a 60 fotogrames per segon, amb 24 fotogrames per segon — el ritme clàssic del cinema — com a per defecte. El clip per defecte és de 121 fotogrames en format landscape 16:9, ideal per a vídeo panoràmic i social, però pots triar altres enquadraments per adaptar-te al teu projecte. La velocitat de reproducció i la longitud funcionen junts, així que un comptador de fotogrames més llarg a una freqüència d'imatges més baixa et dona un moment més lent i allargat, mentre que una freqüència més alta dona un moviment més suau.
Un dels instruments creatius més destacats és el control directe de la càmera. En lloc d'esperar que el model interpreti una frase com «push in on the subject», pots seleccionar d'un conjunt de moviments reals de càmera: dolly in, dolly out, dolly left, dolly right, jib up, jib down o un pla estàtic locked-off. Aquests et donen el tipus de llenguatge de càmera deliberat i repetible del qual depenen els cineastes, i pots ajustar la intensitat del moviment amunt o avall perquè se senti subtil o dramàtic. Això facilita molt obtenir un moviment intencional que recolzi la teva narració en lloc d'un deriva aleatori.
L'àudio es genera al costat del vídeo per defecte, i pots apagar-lo si només necessites imatges silencioses. També tens controls creatius separats per a com de estretament l'àudio i el vídeo segueixen el teu prompt cadascun, i com equilibren entre ells — útil quan vols que el paisatge sonor sigui prominent o quan vols mantenir l'enfocament fermament en les visuals.
Per ajudar amb la coherència general i els detalls fins, el model utilitza un enfocament multi-escala. Primer esboça el vídeo a una escala més petita, després utilitza aquest esbós per guiar un render final més gran i detallat. El resultat és una consistència més forta i detalls més nets que generar a mida completa en un sol tret. Pots ajustar encara més com de estretament el model segueix el teu prompt enfront de quanta llibertat creativa pren, regular el nivell de refinament per equilibrar velocitat i poliment, i utilitzar una opció de variació controlada que pot elevar la qualitat en escenes complicades.
Un prompt negatiu et dona una manera d'allunyar el model d'aparençes que no vols. Per defecte evita coses com estètiques de dibuixos animats i videojocs, text a la pantalla, marques d'aigua, logos, subtítols, moviment lent i imatges estàtiques i planes — impulsant els resultats cap a un sentir més cinematogràfic i live-action. Pots reescriure'l per adaptar-lo als teus propis objectius estètics.
Pel que fa a la sortida, pots exportar en diversos formats per adaptar-te al teu flux de treball: MP4 estàndard, WebM, ProRes per a pipelines d'edició d'alta gamma, o GIF animat per a compartició lleugera. Els nivells de qualitat van des de baix fins a màxim, i pots inclinar el fitxer cap a una escriptura més ràpida, mida més petita o un equilibri mitjà. Les configuracions d'acceleració et permeten intercanviar entre velocitat de generació i fidelitat segons si estàs iterant ràpidament o finalitzant un pla hero.
Per a la reproductibilitat, pots establir una seed perquè el mateix prompt i configuracions produeixin el mateix resultat — pràctic quan vols fer canvis petits i controlats en lloc de començar de zero cada vegada. Un verificador de seguretat integrat està activat per defecte.
LTX-2.3 22B està millor adaptat a vídeo cinematogràfic de curta durada: peces d'ambient, plans de concepte, clips socials, animàtics i exploració d'idees on tenir so sincronitzat integrat estalvia tot un pas d'edició. Com que els clips es mesuren en fotogrames i es generen com a moments autònoms, brilla en plans evocadors individuals en lloc de narratives llargues i multi-escena. Treure'n el màxim depèn d'escriure prompts descriptius i cinematogràfics, triar un moviment de càmera intencional i deixar que el render multi-escala i el refinament facin la seva feina. Amb la seva combinació de vídeo impulsat per prompts, àudio natiu i control precís de la càmera, ofereix als creadors un camí ràpid des d'una idea escrita fins a una escena en moviment i amb so.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descriu l'escena del teu vídeo amb moviment, angles de càmera i ambient
El model crea moviment cinematogràfic amb física i il·luminació naturals
Descarrega i comparteix el teu vídeo a punt per publicar
Mostra moviment de seguiment sostingut, dinàmica de vehicles i generació d'àudio de motor en una seqüència cinematogràfica panoràmica feta per a YouTube i cinema.
Demostra dinàmiques de boira atmosfèrica, transicions d'il·luminació i àudio natural immersiu per a contingut de paisatges documentals d'estil Netflix.
Destaca la generació audiovisual sincronitzada del model amb so de públic, il·luminació d'escenari dinàmica i moviment de càmera enèrgic per a cinema panoràmic.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passa't avui a la síntesi guiada per raonament

Text to video with audio
0.3 crèdits

Fast balanced text-to-video generation
1.6 crèdits

Cinematic video from references
0.4 crèdits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crèdits

Cinematic video with native audio
1.4 crèdits

Frontier 2K text-to-video generation
7.3 crèdits

Fast cinematic video with audio
0.1 crèdits

Cinematic video from references
10 crèdits

Film-grade video with audio
0.1 crèdits