ShortGenius
Voici Grok Imagine Video 1.5 Reference to Video

Grok Imagine Video 1.5 Reference to Video

Blend up to 7 reference images into one guided clip

Video from image, audio references

ANIMATION PORTRAIT

ANIMATION PORTRAIT

PORTRAIT PARLANT

Grok Imagine Video 1.5 Reference to Video est un modèle image-vers-vidéo de xAI qui transforme vos images de référence et une invite écrite en clips vidéo animés. Au lieu de partir de zéro, vous fournissez au modèle une ou plusieurs images de référence et décrivez la scène souhaitée, puis laissez-le générer un mouvement qui propage le style et le contenu de ces références dans une vidéo terminée.

Ce qui distingue ce modèle, c'est la façon dont il utilise les références. Vous pouvez fournir de une à sept images de référence, et le modèle les traite comme des guides pour le style et le contenu. Dans votre invite, vous pointez vers des images spécifiques à l'aide de balises simples comme <IMAGE_0>, <IMAGE_1>, etc. Cela vous permet d'écrire des instructions telles que « La personne de <IMAGE_0> marche dans une rue pluvieuse illuminée par des néons », afin que le modèle sache exactement quel sujet ou élément de style extraire de chaque image. Ce système de balisage offre un contrôle créatif précis sur la combinaison de plusieurs sources visuelles dans un seul plan, ce qui est particulièrement utile quand vous voulez faire apparaître un personnage d'une image dans un décor ou un style tiré des autres.

Le modèle est conçu pour un travail stylisé et transformateur, et inclut une capacité de synchronisation labiale, ce qui le rend idéal pour donner vie à des personnages et portraits avec un mouvement expressif et coordonné. Comme il accepte des entrées image, audio et texte, vous pouvez superposer plusieurs types de directives : images pour définir l'apparence, texte pour décrire l'action, et audio pour guider le rythme et les mouvements de la bouche. La sortie est toujours un fichier vidéo prêt à intégrer dans votre montage ou à partager directement.

Les professionnels créatifs apprécieront la flexibilité pour cadrer et rythmer le clip final. Vous pouvez choisir parmi une large gamme de ratios d'aspect, y compris grand écran 16:9 pour une visualisation cinématographique et bureau, vertical 9:16 pour les formats sociaux comme les reels et stories, carré 1:1 pour les flux, et plusieurs options intermédiaires telles que 4:3, 3:2, 2:3 et 3:4. Vous pouvez ainsi générer des vidéos adaptées précisément à la plateforme ou au format visé, sans recadrage ni reformatage. La durée vidéo est aussi ajustable, de une seconde à quinze secondes, pour créer une boucle rapide, une courte scène ou une séquence plus longue selon votre projet.

Pour la qualité de sortie, le modèle propose deux choix de résolution : 480p pour des clips plus rapides et légers, et 720p pour un résultat plus net et détaillé. Les exemples de sortie fonctionnent à 24 images par seconde, pour un mouvement fluide à cadence cinématographique. Un clip grand écran 720p mesure 1280 x 720 pixels, ce qui convient bien à la plupart des contextes en ligne et aperçus.

Qui tire le plus grand bénéfice de ce modèle ? Les artistes et illustrateurs peuvent animer leurs œuvres ou designs de personnages existants, en voyant une pièce statique bouger et performer. Les designers peuvent transformer des planches de référence et images d'ambiance en pièces conceptuelles animées. Les cinéastes et créateurs vidéo peuvent prototyper des plans en combinant un sujet avec un environnement décrit, pour générer rapidement des clips de prévisualisation avant de s'engager dans une production complète. Les créateurs de contenu pour diverses plateformes sociales peuvent transformer des images de référence en courtes vidéos stylisées formatées précisément pour les flux verticaux, carrés ou grand écran. Grâce au support de synchronisation labiale, toute personne produisant des personnages parlants, avatars animés ou courts métrages narrés peut associer un portrait à un audio pour créer des clips de performance synchronisés.

Les meilleurs résultats proviennent d'invitations réfléchies. Puisque le modèle lit à la fois vos images de référence et votre description textuelle, décrire clairement l'action tout en balisant les bonnes images l'aide à comprendre précisément ce qui doit bouger et comment. Avec plusieurs références, assigner un rôle à chacune dans votre invite, comme une image pour le personnage et une autre pour l'environnement ou le style, maintient la composition cohérente. Souvenez-vous que vous pouvez combiner jusqu'à sept images, ce qui laisse de la place pour bâtir des scènes richement superposées, mais un ensemble focalisé de références avec une invite claire produit souvent les résultats les plus nets et contrôlables.

Quelques considérations pratiques valent la peine d'être retenues. Au moins une image de référence et une invite textuelle sont requises pour chaque génération, car le modèle est conçu pour guider sa sortie avec des références visuelles plutôt que de générer uniquement à partir de texte. La résolution maximale est de 720p, ce modèle vise donc les vidéos stylisées, transformatrices et prêtes pour les réseaux sociaux plutôt que la finition haute résolution en grand format. La durée des clips est limitée à quinze secondes, ce qui convient bien aux récits courts, boucles et contenu social. Dans ces limites, la combinaison de référencement multi-images, cadrage flexible, durée ajustable et synchronisation labiale en fait un outil polyvalent pour transformer des images fixes en mouvement expressif.

En résumé, Grok Imagine Video 1.5 Reference to Video est un outil d'animation piloté par références qui donne aux créateurs un contrôle direct sur la transformation de leurs images en vidéo. En vous permettant de baliser des références spécifiques dans votre invite, de choisir parmi un large éventail de ratios d'aspect, d'ajuster la durée et la résolution, et même de synchroniser les mouvements de bouche à l'audio, il place les décisions créatives entre vos mains tout en gérant la génération du mouvement pour vous.

Générez avec le modèle vidéo le plus avancé

Votre image

Add the image that you want change

Étape 1

Téléverser une image

Ajoutez une image facultative pour guider le rendu, le personnage ou l'environnement

A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.

Étape 2

Rédigez votre scénario

Saisissez une consigne - Le modèle comprend la physique, l'éclairage et l'intention émotionnelle de votre scène

Étape 3

Commencez à partager

Cliquez pour générer votre résultat final et télécharger une vidéo de qualité professionnelle

Au-delà de la consigne : un nouveau niveau de contrôle

ORBITALE PARALLAXE

ORBITALE PARALLAXE

Démontre parallaxe multi-images : caméra glisse porte, avant-plan plus rapide qu'arrière. Showcase architecture ciné 16:9.

MÉTÉO CAUSALE

MÉTÉO CAUSALE

Physique causale : pluie mid-clip, gouttes ondulent flaques/assombrissent pavé séquentiel. Transformation atmosphérique large ciné.

BOUCLE CINEMAGRAPH

BOUCLE CINEMAGRAPH

Cinemagraph boucle seamless : vapeur tourbillonne, reflets néon scintillent, reste figé. Parfait ambiance paysage infinie.

Comparer avec des modèles similaires

Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.

L'attente est enfin terminée

Découvrez la perfection avec Grok Imagine Video 1.5 Reference to Video

Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Foire aux questions

Vous pouvez inclure de une à sept images de référence dans une seule génération. Chaque image guide à la fois le style et le contenu de la vidéo, et vous pouvez pointer vers des spécifiques dans votre invite pour que le modèle sache exactement quel sujet ou style extraire de chacune.