Text to video with audio
Grok Imagine Video 1.5 Text to Video, développé par xAI, transforme des descriptions écrites en courts clips vidéo complets avec audio, le tout à partir d'une seule invite textuelle. Vous décrivez la scène souhaitée, et le modèle génère un clip animé avec son correspondant à vos mots. Aucune image ou vidéo de référence n'est requise au préalable. Il suffit d'écrire, et le modèle gère le reste, ce qui en fait l'un des moyens les plus directs pour passer d'une idée dans votre tête à un clip fini à l'écran.
Au cœur de ce modèle se trouve la narration pilotée par invite. Votre description textuelle peut atteindre une longueur généreuse, vous laissant la place pour détailler les personnages, décors, éclairage, ambiance, mouvement et style autant que vous le souhaitez. Un exemple d'invite montre la gamme expressive à laquelle le modèle répond : "Anime schoolgirl bursting out of house door, cherry blossoms blowing, morning light, speed lines indicating rush, chibi-ready expressions, classic shojo aesthetic, vibrant colors." Cette seule phrase intègre personnage, action, environnement, éclairage et un style visuel très spécifique, et le modèle s'efforce de rassembler tous ces éléments en un clip animé cohérent.
L'une des fonctionnalités phares du modèle est qu'il génère de l'audio en même temps que les visuels. Plutôt que de produire un clip silencieux que vous devriez scorer ou designer son séparément, il livre une vidéo avec son intégré dès le départ. Le modèle est orienté vers des sorties stylisées, des transformations et du lipsync, ce qui indique son aisance avec des scènes expressives centrées sur les personnages où les bouches, expressions et mouvements doivent être connectés à l'action à l'écran.
Vous avez un vrai contrôle sur la forme et la durée de votre sortie. La durée est ajustable, vous permettant de produire de une seconde rapide à un clip de quinze secondes, pour adapter la longueur à ce que vous créez, que ce soit une boucle sociale punchy ou un moment narratif plus long. La valeur par défaut est de six secondes, une longueur confortable pour la plupart des idées courtes. La résolution peut être définie à 480p, 720p ou 1080p, vous offrant le choix entre des brouillons rapides et légers ou des rendus finaux plus nets et détaillés. Le 720p par défaut offre un équilibre pratique entre clarté et efficacité.
Le support des ratios d'aspect est inhabituellement large. Vous pouvez choisir le widescreen 16:9 pour un cadrage cinématographique et paysage, le tall 9:16 pour les formats mobiles et sociaux verticaux, le square 1:1 pour les posts adaptés aux flux, et une gamme d'options intermédiaires incluant 4:3, 3:2, 2:3 et 3:4. Cette flexibilité signifie que vous pouvez générer un clip déjà cadré correctement pour sa destination, que ce soit une bande-annonce horizontale, une story verticale ou un carreau social carré, sans recadrage ou reformatage après coup.
Le modèle produit des vidéos MP4 standard, qui se jouent et se partagent facilement dans les outils d'édition, plateformes sociales et logiciels de présentation. Les clips sont rendus à 24 frames per second, un taux d'images associé depuis longtemps à un look filmique et cinématographique, et le modèle produit la séquence complète d'images nécessaire pour remplir la durée choisie.
Ce modèle convient naturellement à une large gamme de professionnels créatifs. Les animateurs et illustrateurs peuvent exploiter ses forces stylisées pour donner vie à des esthétiques comme l'anime, le chibi, le shojo et d'autres illustrations en mouvement. Les créateurs de réseaux sociaux et marketeurs peuvent générer des clips verticaux et carrés adaptés à leurs plateformes sans reformatage supplémentaire. Les cinéastes et artistes de storyboard peuvent visualiser rapidement des scènes, ambiances et énergies de caméra avant de s'engager dans une production complète. Les designers et équipes de contenu peuvent produire de courts moments brandés, concepts animés et clips de personnages expressifs directement à partir d'un brief écrit. Comme il ne nécessite rien d'autre qu'une invite, il abaisse la barrière pour quiconque a une vision forte mais pas le pipeline de tournage ou de dessin pour la réaliser.
Travailler avec le modèle récompense les invites descriptives et multicouches. Plus vous nommez clairement le sujet, l'action, le décor, l'éclairage et le style visuel, plus le résultat reflétera fidèlement votre intention, comme le démontre l'exemple anime. Empiler des indices stylistiques spécifiques, mots d'ambiance et descriptions de mouvement donne au modèle une cible plus riche. Si vous voulez un look stylisé ou transformateur, le dire explicitement avec l'esthétique visée aide à orienter la sortie.
Quelques considérations pratiques valent la peine d'être gardées à l'esprit. Les clips sont courts par conception, limités à quinze secondes, donc ce modèle excelle pour des moments percutants et autonomes plutôt que des scènes continues longues. Les résolutions élevées produisent plus de détails mais impliquent plus de travail de rendu, un réglage léger étant pratique pour des itérations rapides et brouillons avant une version polie en 1080p. Comme la sortie est générée entièrement à partir de votre texte, le résultat peut varier entre exécutions, rendant l'itération normale : affinez votre formulation, cadrage et durée, et régénérez jusqu'à obtenir le clip imaginé. Avec sa génération incluant audio, cadrage flexible, durée ajustable et affinité pour du contenu stylisé et expressif, Grok Imagine Video 1.5 Text to Video est un point de départ versatile pour transformer des idées écrites en courts clips sonorisés.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Décrivez votre scène vidéo avec le mouvement, les angles de caméra et l'ambiance
Le modèle crée un mouvement cinématographique avec une physique et un éclairage naturels
Téléchargez et partagez votre vidéo prête à la diffusion
Met en avant contrôle caméra agressif avec mouvement drone FPV one-shot impossible, prouvant maîtrise du mouvement continu et échelle dynamique en widescreen.
Exploite le réalisme du modèle pour comédie absurde bodycam fictive avec dialogue synchronisé, format conçu pour viralité par authenticité deadpan.
Démontre contrôle caméra précis et mouvement temporel avec hyperlapse accéléré et dynamiques de traînées lumineuses continues, idéal pour clip hero 16:9 cinématographique.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Fast balanced text-to-video generation
1.6 crédits

Frontier 2K text-to-video generation
7.3 crédits

Film-grade video with audio
0.1 crédits
Text to video with audio
0.7 crédits

Cinematic video with native audio
1.4 crédits

Fast cinematic video with audio
0.1 crédits

Cinematic video from references
10 crédits

Cinematic video from references
0.4 crédits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crédits