Text to video with audio
LTX-2.3 22B transforme une seule invite écrite en un clip vidéo fini complet avec son propre audio synchronisé. Au lieu de générer un clip silencieux puis de chercher des effets sonores ou de la musique à superposer après coup, vous décrivez la scène souhaitée et le modèle livre des images en mouvement et un son correspondant en une seule passe. Cela en fait un outil idéal pour les cinéastes créant des prévisualisations rapides, les créateurs de contenu produisant des clips sociaux courts, les motion designers explorant des idées, et tout artiste souhaitant voir un concept s’animer visuellement et sonorement sans toucher à une timeline.
Au cœur du modèle, il lit votre invite textuelle et en construit une vidéo. Une bonne invite décrit non seulement ce qui apparaît à l’écran, mais aussi comment cela se ressent — par exemple, « Un cow-boy marchant dans une ville poussiéreuse à midi, caméra suivant de derrière, profondeur cinématographique, éclairage réaliste, ambiance western, grain de film 4K. » Plus vous décrivez l’ambiance, l’éclairage, le comportement de la caméra et la texture, plus le résultat se rapproche de ce que vous aviez imaginé. Le modèle peut aussi étendre automatiquement votre invite, en ajoutant des détails cinématographiques pour que même une description plus courte produise un plan riche et cohérent.
Vous avez un large contrôle sur la forme et la durée de votre clip. Les vidéos peuvent durer de 9 images à 481 images, et vous réglez le taux de rafraîchissement de 1 à 60 images par seconde, avec 24 images par seconde — le rythme classique du cinéma — par défaut. Le clip par défaut fait 121 images au format paysage 16:9, parfait pour les vidéos grand écran et sociales, mais vous pouvez choisir d’autres cadrages pour votre projet. La vitesse de lecture et la durée fonctionnent ensemble, donc un nombre d’images plus élevé à un taux plus bas donne un moment plus lent et étiré, tandis qu’un taux plus élevé donne un mouvement plus fluide.
L’un des outils créatifs phares est le contrôle direct de la caméra. Plutôt que d’espérer que le modèle interprète une phrase comme « zoom avant sur le sujet », vous pouvez sélectionner parmi des mouvements de caméra réels : dolly in, dolly out, dolly left, dolly right, jib up, jib down, ou un plan statique verrouillé. Cela vous donne le type de langage caméra délibéré et reproductible sur lequel comptent les cinéastes, et vous pouvez ajuster l’intensité du mouvement pour qu’il soit subtil ou dramatique. Cela rend beaucoup plus facile d’obtenir un mouvement intentionnel qui soutient votre récit au lieu d’une dérive aléatoire.
L’audio est généré avec la vidéo par défaut, et vous pouvez le désactiver si vous n’avez besoin que d’images silencieuses. Vous avez aussi des réglages créatifs séparés pour contrôler à quel point l’audio et la vidéo adhèrent chacun à votre invite, et comment ils s’équilibrent l’un par rapport à l’autre — utile quand vous voulez que le paysage sonore soit proéminent ou garder le focus fermement sur les visuels.
Pour améliorer la cohérence globale et les détails fins, le modèle utilise une approche multi-échelle. Il esquisse d’abord la vidéo à petite échelle, puis utilise ce brouillon pour guider un rendu final plus grand et détaillé. Le résultat offre une meilleure consistance et des détails plus nets que la génération en pleine taille en une seule fois. Vous pouvez affiner davantage la fidélité au prompt versus la liberté créative du modèle, ajuster le niveau de raffinement pour équilibrer vitesse et finition, et utiliser une option de variation contrôlée qui améliore la qualité sur des scènes difficiles.
Un prompt négatif vous permet d’écarter les styles que vous ne voulez pas. Par défaut, il évite les esthétiques cartoon et vidéo-ludiques, le texte à l’écran, les filigranes, logos, sous-titres, le ralenti et les plans statiques plats — orientant les résultats vers une sensation plus cinématographique et live-action. Vous pouvez le réécrire pour vos propres objectifs esthétiques.
Pour la sortie, vous pouvez exporter dans plusieurs formats adaptés à votre workflow : MP4 standard, WebM, ProRes pour les pipelines d’édition haut de gamme, ou GIF animé pour un partage léger. Les niveaux de qualité vont de bas à maximum, et vous pouvez orienter le fichier vers une écriture plus rapide, une taille plus petite, ou un équilibre moyen. Les paramètres d’accélération vous permettent d’échanger entre vitesse de génération et fidélité selon que vous itérez rapidement ou finalisez un plan hero.
Pour la reproductibilité, vous pouvez définir une seed afin que la même invite et les mêmes réglages produisent le même résultat — pratique pour effectuer de petits changements contrôlés plutôt que de repartir de zéro à chaque fois. Un vérificateur de sécurité intégré est activé par défaut.
LTX-2.3 22B est idéal pour les vidéos cinématographiques courtes : pièces d’ambiance, plans conceptuels, clips sociaux, animatiques et exploration d’idées où le son synchronisé intégré économise une étape d’édition entière. Comme les clips sont mesurés en images et générés comme des moments autonomes, il excelle dans les plans uniques évocateurs plutôt que les récits longs à plusieurs scènes. Pour en tirer le meilleur, il s’agit d’écrire des invites descriptives et cinématographiques, de choisir un mouvement de caméra intentionnel, et de laisser le rendu multi-échelle et le raffinement faire leur travail. Avec sa combinaison de vidéo pilotée par invite, audio natif et contrôle précis de la caméra, il offre aux créateurs un chemin rapide d’une idée écrite à une scène en mouvement et sonorisée.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Décrivez votre scène vidéo avec le mouvement, les angles de caméra et l'ambiance
Le modèle crée un mouvement cinématographique avec une physique et un éclairage naturels
Téléchargez et partagez votre vidéo prête à la diffusion
Montre un mouvement de travelling soutenu, dynamiques de véhicule et génération audio moteur dans une séquence cinématographique grand écran pour YouTube et cinéma.
Démontre les dynamiques de brouillard atmosphérique, transitions d’éclairage et audio naturel immersif pour du contenu paysage documentaire style Netflix.
Met en avant la génération audio-visuelle synchronisée du modèle avec sons de foule, éclairage scène dynamique et mouvement caméra énergique pour cinéma paysage.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Multi-shot cinematic text-to-video
4 crédits

Fast cinematic video with audio
0.1 crédits

Cinematic video with native audio
1.4 crédits

Film-grade video with audio
0.1 crédits

Cinematic video from references
10 crédits

Cinematic video from references
0.4 crédits

Fast balanced text-to-video generation
1.6 crédits