Frontier 2K text-to-video generation
MiniMax H3 Text to Video est un modèle de génération vidéo de pointe qui transforme une description écrite en séquences vidéo terminées. Vous saisissez une invite, décrivez la scène, le mouvement et l'ambiance souhaités, et le modèle la rend en image animée. Aucune photo de référence, storyboard ou clip n'est nécessaire ; le texte seul suffit pour produire un plan complet.
Le modèle rend jusqu'à une résolution 2K et prend en charge des durées de 5 à 15 secondes, vous offrant la flexibilité pour créer tout, d'une boucle rapide à un rythme plus long et développé. Cette souplesse de durée est précieuse pour le travail créatif : un clip de 5 secondes est idéal pour une accroche sociale percutante ou une transition, tandis qu'un rendu de 15 secondes laisse de l'espace pour le mouvement de caméra, le déroulement de l'action et la respiration de la scène. Vous choisissez la durée exacte pour chaque génération, afin que la sortie s'adapte parfaitement à l'emplacement prévu, sans besoin de couper ou d'étirer ultérieurement.
L'une des fonctionnalités phares est la variété des ratios d'aspect. MiniMax H3 prend en charge sept options de cadrage : ultra-large 21:9, grand écran 16:9, classique 4:3, carré 1:1, portrait 3:4, et vertical 9:16. Cette gamme couvre presque tous les formats de diffusion utilisés par les créateurs aujourd'hui. Le vertical 9:16 est conçu pour les plateformes short-form et le storytelling mobile-first, le 16:9 convient aux vidéos standard et aux présentations, le 21:9 offre un look letterbox cinématographique, et le carré 1:1 est parfait pour les publications en flux. Comme le ratio d'aspect est défini au moment de la génération, les images sont composées correctement dès le départ, avec un cadrage et un mouvement adaptés à la forme choisie.
La résolution est un autre levier créatif. Vous pouvez opter pour un rendu léger en 768P ou passer à la pleine 2K. L'option 768P est idéale pour explorer rapidement des idées et itérer sur les invites avant de vous engager, tandis que la 2K produit des images nettes et détaillées, prêtes pour une livraison finale polie. Cela permet de passer fluidement du stade de brouillon à la finalisation sans changer d'outil.
MiniMax H3 convient parfaitement à un large éventail de professionnels créatifs. Les cinéastes et monteurs vidéo peuvent générer des plans d'établissement, des ambiances et du B-roll qui nécessiteraient autrement un tournage. Les créateurs de contenus sociaux et les marketeurs peuvent produire des clips verticaux optimisés pour les plateformes short-form, avec un mouvement naturel et un éclairage qui rendent la scène vivante. Les motion designers et artistes peuvent explorer des looks stylisés et des transformations, en utilisant le modèle pour animer des concepts picturaux, surréalistes ou difficiles à filmer. Conçu pour les styles stylisés, les transformations et le lipsync, le modèle va au-delà du réalisme pur et gère également des esthétiques expressives et non littérales.
Rédiger une invite percutante est la clé ici. Le modèle apprécie un langage descriptif et cinématographique. Une invite comme « Un chaton blanc poursuit un papillon à travers un jardin ensoleillé, tracking caméra doux, mouvement naturel, lumière douce de l'après-midi filtrant à travers les feuilles » fournit tout ce qu'il faut : un sujet, une action, un comportement de caméra et une ambiance lumineuse. Plus vous décrivez précisément le mouvement du sujet, le comportement de la caméra et la qualité de la lumière, plus le résultat se rapproche de votre vision. Les invites peuvent atteindre environ 2 000 caractères, offrant ample espace pour préciser ton, rythme, texture et atmosphère en une seule description.
La sortie est un fichier vidéo MP4 standard, téléchargeable et utilisable directement dans votre montage, timeline ou planificateur social. Aucune conversion supplémentaire n'est nécessaire pour l'intégrer dans la plupart des workflows créatifs.
Quelques points pratiques à retenir. Ce mode fonctionne uniquement à partir de texte, donc pour baser une vidéo sur une image existante ou un frame de référence, cela sort du cadre de ce mode text-to-video. La durée maximale d'un clip est de 15 secondes, ce qui signifie que les séquences plus longues se construisent mieux en générant plusieurs plans et en les montant ensemble plutôt qu'en attendant un plan-séquence continu. Comme la génération dépend de l'invite, les résultats varient d'une exécution à l'autre : il est normal de produire plusieurs versions, de sélectionner la meilleure et d'affiner la description. Commencer en 768P pour explorer et passer à 2K une fois l'invite optimisée est une méthode efficace.
Globalement, MiniMax H3 Text to Video offre aux créateurs un raccourci rapide d'une idée écrite à des images exploitables, avec un contrôle précis sur la durée, le cadrage et la résolution. Sa combinaison de durées jusqu'à 15 secondes, sept ratios d'aspect et sortie 2K en fait un choix polyvalent pour toute vidéo adaptée à un format spécifique et prête à l'emploi, qu'il s'agisse d'une séquence ultra-large cinématographique, d'un clip vertical mobile ou d'une création stylisée impossible à filmer.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Décrivez votre scène vidéo avec le mouvement, les angles de caméra et l'ambiance
Le modèle crée un mouvement cinématographique avec une physique et un éclairage naturels
Téléchargez et partagez votre vidéo prête à la diffusion
Un plan drone FPV one-shot impossible démontre la précision caméra avec une séquence piqué-relevée en paysage cinématique.
Hyperlapse urbain avec traînées lumineuses continues : mouvement fluide constant et caméra précise sur une longue séquence paysage.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Cinematic video from references
10 crédits

Fast balanced text-to-video generation
1.6 crédits

Film-grade video with audio
0.1 crédits
Text to video with audio
0.7 crédits

Cinematic video from references
0.4 crédits

Fast cinematic video with audio
0.1 crédits

Cinematic video with native audio
1.4 crédits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crédits

Text to video with audio
0.3 crédits