Text to video with audio
Grok Imagine Video 1.5 Text to Video, développé par xAI, transforme des descriptions écrites en courts clips vidéo accompagnés d’audio, le tout à partir d’une seule invite textuelle. Vous décrivez la scène que vous voulez, et le modèle génère un clip animé avec son qui correspond à vos mots. Aucune image ou séquence de référence n’est requise au préalable. Vous écrivez simplement, et le modèle s’occupe du reste, ce qui en fait l’un des moyens les plus directs pour passer d’une idée dans votre tête à un clip fini à l’écran.
Au cœur de ce modèle se trouve la narration pilotée par invite. Votre description textuelle peut atteindre une longueur généreuse, vous donnant l’espace pour détailler les personnages, les décors, l’éclairage, l’ambiance, le mouvement et le style autant que vous le souhaitez. Un exemple d’invite montre la gamme expressive à laquelle le modèle répond : "Anime schoolgirl bursting out of house door, cherry blossoms blowing, morning light, speed lines indicating rush, chibi-ready expressions, classic shojo aesthetic, vibrant colors." Cette seule phrase regroupe personnage, action, environnement, éclairage et un style visuel très spécifique, et le modèle s’efforce de réunir tous ces éléments en un clip animé cohérent.
L’une des fonctionnalités phares du modèle est qu’il génère l’audio en même temps que les visuels. Plutôt que de produire un clip silencieux que vous devriez scorer ou concevoir sonorement séparément, il fournit une vidéo avec son intégré dès le départ. Le modèle est orienté vers des sorties stylisées, des transformations et la synchronisation labiale, ce qui indique son aisance avec des scènes expressives centrées sur les personnages où les bouches, les expressions et les mouvements doivent sembler connectés à ce qui se passe à l’écran.
Vous avez un contrôle réel sur la forme et la longueur de votre sortie. La durée est ajustable, vous permettant de produire tout, d’un court battement d’une seconde jusqu’à un clip de quinze secondes, afin que vous puissiez adapter la longueur à ce que vous créez, qu’il s’agisse d’une boucle sociale rapide ou d’un moment narratif plus long. La valeur par défaut est de six secondes, une longueur confortable pour la plupart des idées de format court. La résolution peut être définie à 480p, 720p ou 1080p, vous offrant le choix entre des brouillons plus rapides et légers ou des rendus finaux plus nets et détaillés. Le 720p par défaut offre un équilibre pratique entre clarté et efficacité.
Le support des ratios d’aspect est inhabituellement large. Vous pouvez choisir parmi le grand écran 16:9 pour un cadrage cinématographique et paysage, le format vertical 9:16 pour les mobiles et formats sociaux, le carré 1:1 pour les publications adaptées aux flux, et une gamme d’options intermédiaires incluant 4:3, 3:2, 2:3 et 3:4. Cette flexibilité signifie que vous pouvez générer un clip déjà cadré correctement pour sa destination, qu’il s’agisse d’une bande-annonce horizontale, d’une story verticale ou d’un carreau social carré, sans rognage ou reformatage après coup.
Le modèle produit des vidéos MP4 standard, qui se jouent et se partagent facilement dans les outils de montage, les plateformes sociales et les logiciels de présentation. Les clips sont rendus à 24 images par seconde, un taux de cadence longtemps associé à un look filmique et cinématographique, et le modèle produit la séquence complète d’images nécessaire pour remplir la durée choisie.
Ce modèle convient naturellement à une large gamme de professionnels créatifs. Les animateurs et illustrateurs peuvent s’appuyer sur ses forces stylisées pour donner vie à l’anime, au chibi, au shojo et à d’autres esthétiques illustrées en mouvement. Les créateurs de médias sociaux et les marketeurs peuvent générer des clips verticaux et carrés adaptés à leurs plateformes sans reformatage supplémentaire. Les cinéastes et artistes de storyboard peuvent rapidement visualiser des scènes, des ambiances et de l’énergie de caméra avant de s’engager dans une production plus complète. Les designers et équipes de contenu peuvent produire de courts moments de marque, des concepts animés et des clips de personnages expressifs directement à partir d’un brief écrit. Comme il ne nécessite rien d’autre qu’une invite, il abaisse aussi la barrière pour quiconque a une vision forte mais pas la séquence ou le pipeline de dessin pour la réaliser.
Travailler avec le modèle récompense les invites descriptives et superposées. Plus vous nommez clairement le sujet, l’action, le décor, l’éclairage et le style visuel, plus le résultat reflétera fidèlement votre intention, comme le démontre l’exemple anime. Empiler des indices stylistiques spécifiques, des mots d’ambiance et des descriptions de mouvement donne au modèle une cible plus riche à viser. Si vous voulez un look stylisé ou transformateur, le dire explicitement, avec l’esthétique visée, aide à orienter la sortie dans cette direction.
Quelques considérations pratiques valent la peine d’être gardées à l’esprit. Les clips sont courts par conception, limités à quinze secondes, donc ce modèle excelle pour des moments percutants et autonomes plutôt que des scènes continues longues. Les résolutions plus élevées produisent plus de détails mais impliquent naturellement plus de travail de rendu, donc un réglage plus léger peut être utile pour une itération rapide et des brouillons avant de vous engager dans une version polie en 1080p. Comme la sortie est générée entièrement à partir de votre texte, le résultat exact peut varier entre les exécutions, ce qui rend l’itération une partie normale du processus : affinez votre formulation, ajustez votre cadrage et votre longueur, et régénérez jusqu’à ce que le clip corresponde à votre imagination. Avec sa combinaison de génération incluant l’audio, de cadrage flexible, de longueur ajustable et d’une affinité claire pour un contenu stylisé et expressif, Grok Imagine Video 1.5 Text to Video est un point de départ polyvalent pour transformer des idées écrites en courts clips avec son.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Décrivez votre scène vidéo avec le mouvement, les angles de caméra et l'ambiance
Le modèle crée un mouvement cinématographique avec une physique et un éclairage naturels
Téléchargez et partagez votre vidéo prête pour la production
Met en scène un contrôle caméra agressif avec un mouvement drone FPV one-shot impossible, prouvant la maîtrise du mouvement continu et de l’échelle dynamique en grand écran.
Exploite le réalisme du modèle pour une comédie absurde bodycam factice avec dialogue synchronisé, un format conçu pour devenir viral grâce à une authenticité impassible.
Démontre un contrôle caméra précis et un mouvement temporel avec un hyperlapse accélérant et des dynamiques de traînées lumineuses continues, idéal pour un clip héros cinématique 16:9.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Frontier 2K text-to-video generation
7.3 crédits

Cinematic video from references
0.4 crédits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crédits

Film-grade video with audio
0.1 crédits

Cinematic video from references
10 crédits

Cinematic video with native audio
1.4 crédits
Text to video with audio
0.7 crédits

Fast cinematic video with audio
0.1 crédits

Fast balanced text-to-video generation
1.6 crédits