Text to video with audio
Grok Imagine Video 1.5 (Text to Video), développé par xAI, transforme des invites textuelles en courts clips vidéo avec audio intégré. Plutôt que d’enchaîner plusieurs outils pour l’image et le son, décrivez la scène en langage simple et le modèle produit un clip fini, avec mouvement et sa propre piste audio. C’est un moyen rapide et autonome pour les créateurs de tester des idées, créer du contenu social, et prototyper des images en mouvement sans caméra, acteurs ni suite de montage.
Au cœur de son fonctionnement, le modèle lit la description textuelle et interprète à la fois le sujet et la façon dont il doit bouger. Une invite comme « Un chaton blanc poursuit un papillon dans un jardin ensoleillé, suivi de caméra en douceur, mouvements naturels, lumière douce de l’après-midi filtrée à travers les feuilles » donne tout au modèle : le sujet, l’action, le comportement de la caméra et l’ambiance lumineuse. Comme il répond à ce type de direction détaillée et cinématographique, vous pouvez façonner non seulement ce qui apparaît à l’écran, mais aussi le mouvement de la caméra et la façon dont la lumière baigne la scène. Les exemples d’invites montrent aussi sa capacité à gérer des styles comme l’anime et l’esthétique shojo (lignes de vitesse, fleurs de cerisier, couleurs vibrantes, personnages expressifs), donc il passe aisément du photoréalisme à l’illustration stylisée.
Vous contrôlez la durée de chaque clip, de 1 à 15 secondes. Les clips plus courts sont idéals pour des boucles rapides, des moments de réaction ou des extraits sociaux, tandis que les plus longs offrent la place pour un rythme complet ou une courte scène narrative. La durée par défaut est d’environ 6 secondes, parfaite pour des idées en un seul plan. Le rendu se fait à 24 images par seconde, conférant au mouvement une cadence fluide à la manière du cinéma.
La résolution est réglable sur trois niveaux : 480p pour des brouillons rapides, 720p comme standard fiable, et 1080p pour le rendu le plus net et détaillé possible. Cela permet d’itérer rapidement à basse résolution pendant que vous affinez votre invite, puis de générer une version finale propre en haute qualité quand le résultat vous satisfait.
Le format d’image est entièrement flexible, avec un vaste choix de proportions selon l’usage prévu de la vidéo. Produisez en 16:9 écran large pour la lecture paysage, 9:16 vertical pour les fils mobiles et stories, 1:1 carré pour les publications sur grille, ou encore des ratios intermédiaires comme 4:3, 3:2, 2:3 et 3:4. Puisque vous pouvez cadrer verticalement ou horizontalement à partir de la même invite, le modèle s’intègre naturellement dans des flux de contenu multiplateforme, là où la même idée doit exister en plusieurs formats.
Parmi ses points forts : l’audio natif. Plutôt que de livrer un clip muet à sonoriser ensuite, Grok Imagine Video 1.5 génère la vidéo et sa piste audio simultanément. Cela rapproche l’invite textuelle d’un moment fini, particulièrement utile pour les concepts rapides, les tests d’ambiance ou le contenu social où le son ajoute un impact instantané, sans étapes additionnelles.
Le champ d’invite accepte de longues descriptions détaillées allant jusqu’à plusieurs milliers de caractères. Plus vous êtes précis, meilleurs seront les résultats : superposez sujet, action, mouvement de caméra, éclairage, palette de couleurs, style artistique et ambiance en une seule passe. Comme le démontrent les exemples, détailler des points comme « suivi de caméra doux », « lumière d’après-midi filtrée », « lignes de vitesse indiquant la précipitation » ou nommer une esthétique artistique offre une direction claire au modèle et tend à générer un résultat plus conforme à votre intention.
Ce modèle convient à une vaste gamme de professionnels créatifs. Créateurs et marketeurs sur les médias sociaux peuvent créer, en un clin d’œil, des clips verticaux ou carrés accrocheurs. Cinéastes et animateurs peuvent prévisualiser des plans, tester des mouvements de caméra et explorer diverses ambiances avant une production complète. Illustrateurs et designers donnent vie à des univers stylisés grâce au mouvement et au son. Artistes conceptuels et conteurs de récits testent très vite ambiances, rythmes et idées visuelles, générant plusieurs variantes pour comparer. Entièrement guidé par le texte et sans besoin de matériel source, il démocratise la vidéo animée pour tous, même sans équipement ni budget de tournage classique.
Quelques points pratiques à garder à l’esprit. Le modèle ne travaille qu’à partir du texte, sans image ou référence en entrée : tout est généré à partir de votre description écrite seulement. Le processus reste donc simple, mais la clarté et la précision de votre invite sont déterminantes pour le résultat ; une invite vague aboutira à quelque chose de générique, alors qu’une description précise rapproche du résultat voulu. La longueur maximale d’un clip est de 15 secondes, c’est donc un outil pour des moments courts et des plans uniques plutôt que pour de longues séquences continues (vous pouvez toutefois assembler plusieurs clips). Les demandes sont soumises aux modalités d’utilisation de xAI.
En résumé, Grok Imagine Video 1.5 (Text to Video) offre une façon polyvalente et autonome de passer d’une idée à un court vidéo animé, avec son inclus. Avec durée ajustable jusqu’à 15 secondes, trois paliers de résolution jusqu’à 1080p, un choix complet de formats d’image, fluidité à 24 fps et audio intégré, il fournit aux créateurs une base flexible pour tout, du test social rapide à la pièce conceptuelle raffinée.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Décrivez votre scène vidéo avec le mouvement, les angles de caméra et l'ambiance
Le modèle crée un mouvement cinématographique avec une physique et un éclairage naturels
Téléchargez et partagez votre vidéo prête pour la production
Démontre un contrôle caméra agressif avec un plan drone FPV impossible, prouvant la maîtrise du modèle pour un mouvement fluide et une échelle dynamique en écran large.
Exploite le réalisme du modèle pour une comédie absurde de faux bodycam avec dialogue synchronisé, conçu pour devenir viral grâce à l’authenticité pince-sans-rire.
Montre le contrôle précis de la caméra et du mouvement temporel via un hyperlapse accéléré avec traînées lumineuses dynamiques, idéal pour un clip héroïque cinématographique 16:9.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Cinematic video from references
10 crédits

Fast cinematic video with audio
0.1 crédits
Text to video with audio
0.7 crédits

Cinematic video with native audio
1.4 crédits

Film-grade video with audio
0.1 crédits

Fast balanced text-to-video generation
1.6 crédits

Cinematic video from references
0.4 crédits

Frontier 2K text-to-video generation
7.3 crédits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crédits