Text to video with audio
Grok Imagine Video 1.5 (Text to Video), développé par xAI, transforme des invites écrites en courts clips vidéo complets avec audio. Au lieu de combiner des outils séparés pour les visuels et le son, vous décrivez la scène que vous voulez en langage courant et le modèle produit un clip fini avec du mouvement et sa propre piste audio. Cela en fait un moyen rapide et autonome pour les créateurs de tester des idées, de créer du contenu social et de prototyper des images en mouvement sans caméra, acteurs ou suite de montage.
Au cœur du modèle, il lit une description textuelle et interprète à la fois le sujet et la manière dont il doit bouger. Une invite comme « Un chaton blanc poursuit un papillon à travers un jardin ensoleillé, suivi de caméra doux, mouvement naturel, lumière douce de l'après-midi filtrant à travers les feuilles » donne au modèle tout ce dont il a besoin : le sujet, l'action, le comportement de la caméra et l'ambiance lumineuse. Comme il répond à ce type de directions détaillées et cinématographiques, vous pouvez façonner non seulement ce qui apparaît à l'écran, mais aussi le comportement de la caméra et la façon dont la lumière tombe sur la scène. Les exemples d'invite montrent également qu'il gère des travaux stylisés comme les esthétiques anime et shojo avec des lignes de vitesse, des cerisiers en fleurs, des couleurs vives et des personnages expressifs, il passe donc facilement du photoréalisme aux looks illustrés.
Vous contrôlez la durée de chaque clip, en choisissant de 1 à 15 secondes. Les clips plus courts sont idéaux pour des boucles rapides, des moments de réaction et des extraits sociaux, tandis que les durées plus longues offrent de la place pour un battement plus complet ou un petit moment narratif. La durée par défaut est d'environ 6 secondes, ce qui convient à la plupart des idées en un seul plan. La sortie est lue à 24 images par seconde, donnant au mouvement un rythme fluide et cinématographique.
La résolution est ajustable en trois niveaux : 480p pour des brouillons rapides et des tests approximatifs, 720p comme standard quotidien solide, et 1080p pour le résultat le plus net et détaillé pour une pièce finie. Cela vous permet d'itérer rapidement à une résolution inférieure tout en affinant votre invite, puis de générer une version finale propre à une qualité supérieure une fois satisfait de la direction.
Le ratio d'aspect est entièrement flexible, avec une large gamme de formes pour s'adapter à l'endroit où votre vidéo vivra. Vous pouvez produire du 16:9 classique en paysage, du 9:16 vertical pour les formats comme les flux mobiles et stories, du 1:1 carré pour les posts en grille, et des ratios intermédiaires incluant 4:3, 3:2, 2:3 et 3:4. Comme vous pouvez cadrer en vertical ou horizontal à partir de la même invite, le modèle s'intègre naturellement dans des flux de travail multi-plateformes où la même idée doit apparaître dans plusieurs formats.
L'une des fonctionnalités phares est l'audio natif. Au lieu de fournir un clip silencieux que vous devez ensuite scorer ou foley séparément, Grok Imagine Video 1.5 génère la vidéo avec une piste audio accompagnante en même temps. Cela transforme une invite textuelle en quelque chose de plus proche d'un moment fini, particulièrement utile pour des pièces de concept rapides, des tests d'ambiance et du contenu social où le son ajoute beaucoup d'impact sans étapes supplémentaires.
Le champ d'invite est généreux, acceptant des descriptions longues et riches de plusieurs milliers de caractères. Cette marge récompense la spécificité : vous pouvez superposer sujet, action, mouvement de caméra, éclairage, palette de couleurs, style artistique et ambiance en une seule passe. Comme le démontrent les exemples d'invite, mentionner des détails comme « suivi de caméra doux », « lumière douce de l'après-midi », « lignes de vitesse indiquant la hâte » ou une esthétique nommée donne au modèle une direction claire et produit des résultats plus proches de votre intention.
Ce modèle convient parfaitement à une large gamme de professionnels créatifs. Les créateurs de médias sociaux et marketeurs peuvent produire rapidement des clips verticaux ou carrés accrocheurs. Les cinéastes et animateurs peuvent l'utiliser pour prévisualiser des plans, bloquer des mouvements de caméra et explorer des looks avant de s'engager dans une production complète. Les illustrateurs et designers peuvent donner vie à des mondes stylisés avec du mouvement et du son. Les artistes conceptuels et conteurs peuvent tester rapidement des ambiances, des rythmes et des idées visuelles, en générant plusieurs variations à comparer. Comme il est piloté par texte et ne nécessite pas de matériel source, il abaisse la barrière pour quiconque veut des images en mouvement sans équipement ou budget pour un tournage traditionnel.
Quelques considérations pratiques valent la peine d'être gardées à l'esprit. Le modèle fonctionne purement à partir de texte, sans entrée image ou référence, donc tout est généré à partir de votre description écrite seule. Cela garde le processus simple, mais signifie aussi que la clarté et le détail de votre invite font le gros du travail ; une invite vague donnera un résultat plus générique qu'une bien décrite. La durée des clips est limitée à 15 secondes, donc c'est un outil pour des moments courts et plans uniques plutôt que des séquences continues longues, bien que vous puissiez générer plusieurs clips à assembler pour quelque chose de plus long. Les demandes sont soumises aux conditions d'utilisation de xAI.
Globalement, Grok Imagine Video 1.5 (Text to Video) est un moyen versatile et autonome de passer d'une idée en mots à une courte vidéo avec son. Avec une durée ajustable jusqu'à 15 secondes, trois niveaux de résolution jusqu'à 1080p, une gamme complète de ratios d'aspect, un mouvement fluide à 24 fps et un audio intégré, il offre aux créateurs un point de départ flexible pour tout, des expériences sociales rapides aux pièces de concept polies.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Décrivez votre scène vidéo avec le mouvement, les angles de caméra et l'ambiance
Le modèle crée un mouvement cinématographique avec une physique et un éclairage naturels
Téléchargez et partagez votre vidéo prête à la diffusion
Met en avant un contrôle caméra agressif avec un mouvement drone FPV one-shot impossible, prouvant la maîtrise du mouvement continu et de l'échelle dynamique en 16:9.
Exploite le réalisme du modèle pour une comédie absurde bodycam factice avec dialogues synchronisés, un format conçu pour viraliser par authenticité deadpan.
Démontre un contrôle caméra précis et un mouvement temporel avec un hyperlapse accéléré et des dynamiques de traînées lumineuses continues, idéal pour un clip hero cinématographique 16:9.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Cinematic video from references
10 crédits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crédits

Film-grade video with audio
0.1 crédits

Fast cinematic video with audio
0.1 crédits

Cinematic video from references
0.4 crédits
Text to video with audio
0.7 crédits

Frontier 2K text-to-video generation
7.3 crédits

Fast balanced text-to-video generation
1.6 crédits

Cinematic video with native audio
1.4 crédits