ShortGenius
Découvrez Grok Imagine Video 1.5 Reference to Video

Grok Imagine Video 1.5 Reference to Video

Blend up to 7 reference images into one guided clip

Video from image, audio references

ANIMATION PORTRAIT

ANIMATION PORTRAIT

PORTRAIT PARLANT

Grok Imagine Video 1.5 Reference to Video est un modèle image-vers-vidéo de xAI qui transforme vos images de référence et une invite écrite en clips vidéo animés. Plutôt que de partir de zéro, vous fournissez au modèle une ou plusieurs images de référence et décrivez la scène que vous souhaitez, puis laissez-le générer un mouvement qui propage le style et le contenu de ces références dans une vidéo finale.

Ce qui distingue ce modèle, c'est la façon dont il utilise les références. Vous pouvez fournir de une à sept images de référence, et le modèle les traite comme des guides pour le style et le contenu. Dans votre invite, vous pointez vers des images spécifiques en utilisant des balises simples comme <IMAGE_0>, <IMAGE_1>, etc. Cela vous permet d'écrire des instructions telles que « La personne de <IMAGE_0> marche dans une rue pluvieuse éclairée par des néons », afin que le modèle sache exactement quel sujet ou élément de style extraire de chaque image. Ce système de balises vous offre un contrôle créatif précis sur la façon dont plusieurs sources visuelles se combinent dans un seul plan, ce qui est particulièrement utile lorsque vous voulez faire apparaître un personnage d'une image dans un décor ou un style tiré d'autres images.

Le modèle est conçu pour un travail stylisé et transformateur, et inclut une capacité de lip-sync, ce qui le rend idéal pour donner vie à des personnages et des portraits avec un mouvement expressif et coordonné. Comme il accepte des entrées image, audio et texte, vous pouvez superposer plusieurs types de directions simultanément : images pour définir l'apparence, texte pour décrire l'action, et audio pour guider le timing et les mouvements de la bouche. La sortie est toujours un fichier vidéo, prêt à être intégré dans votre montage ou partagé directement.

Les professionnels créatifs trouveront beaucoup de flexibilité dans le cadrage et le rythme du clip final. Vous pouvez choisir parmi une large gamme de ratios d'aspect, y compris 16:9 grand écran pour une visualisation cinématographique et bureau, 9:16 vertical pour les formats sociaux comme les reels et stories, 1:1 carré pour les flux, et plusieurs options intermédiaires telles que 4:3, 3:2, 2:3 et 3:4. Cela signifie que vous pouvez générer des vidéos adaptées exactement à la plateforme ou à la mise en page que vous avez en tête, sans recadrage ni reformatage ultérieur. La longueur de la vidéo est également ajustable, allant d'une seule seconde jusqu'à quinze secondes, afin que vous puissiez créer une boucle rapide, une courte scène ou une séquence plus longue selon votre projet.

Pour la qualité de sortie, le modèle propose deux choix de résolution : 480p pour des clips plus rapides et légers, et 720p pour un résultat plus net et détaillé. Les exemples de sorties fonctionnent à 24 frames per second, conférant au mouvement un rythme fluide et cinématographique. Un clip 720p grand écran sort à 1280 x 720 pixels, ce qui convient bien à la plupart des contextes en ligne et de prévisualisation.

Qui bénéficie le plus de ce modèle ? Les artistes et illustrateurs peuvent animer leurs œuvres existantes ou designs de personnages, voyant une pièce statique se mouvoir et performer. Les designers peuvent transformer des planches de référence et images d'ambiance en pièces conceptuelles animées. Les réalisateurs et créateurs vidéo peuvent prototyper des plans en combinant un sujet avec un environnement décrit, générant des clips de prévisualisation rapides avant de s'engager dans une production complète. Les créateurs de contenu travaillant sur diverses plateformes sociales peuvent transformer des images de référence en courtes vidéos stylisées formatées précisément pour les flux verticaux, carrés ou grand écran. Comme le lip-sync est pris en charge, toute personne produisant des personnages parlants, avatars animés ou courts narrés peut associer un portrait à un audio pour créer des clips de performance synchronisés.

Les meilleurs résultats proviennent d'une invite réfléchie. Comme le modèle lit à la fois vos images de référence et votre description textuelle, décrire l'action clairement tout en balisant les bonnes images l'aide à comprendre exactement ce qui doit bouger et comment. Lorsque vous utilisez plusieurs références, en assignant à chacune un rôle dans votre invite, comme une image pour le personnage et une autre pour l'environnement ou le style, cela maintient la composition cohérente. N'oubliez pas que vous pouvez combiner jusqu'à sept images, ce qui vous donne de la marge pour construire des scènes richement superposées, mais un ensemble focalisé de références avec une invite claire produit souvent les résultats les plus nets et contrôlables.

Quelques considérations pratiques valent la peine d'être gardées à l'esprit. Au moins une image de référence et une invite textuelle sont requises pour chaque génération, car le modèle est construit autour du guidage de sa sortie avec des références visuelles plutôt que de générer à partir de texte seul. La résolution culmine à 720p, donc ce modèle vise les vidéos stylisées, transformatives et prêtes pour les réseaux sociaux plutôt que la finition haute résolution en grand format. La longueur des clips est limitée à quinze secondes, ce qui convient bien aux récits courts, boucles et contenus sociaux. Dans ces limites, la combinaison de références multi-images, cadrage flexible, durée ajustable et lip-sync en fait un outil polyvalent pour transformer des images fixes en mouvement expressif.

En résumé, Grok Imagine Video 1.5 Reference to Video est un outil d'animation piloté par références qui donne aux créateurs un contrôle direct sur la façon dont leurs images deviennent vidéo. En vous permettant de baliser des références spécifiques dans votre invite, de choisir parmi un large ensemble de ratios d'aspect, d'ajuster la longueur et la résolution, et même de synchroniser les mouvements de la bouche à l'audio, il place les décisions créatives entre vos mains tout en gérant la génération du mouvement pour vous.

Générez avec le modèle de vidéo le plus avancé

Votre image

Add the image that you want change

Étape 1

Importer une image

Ajoutez une image facultative pour guider le style, le personnage ou l'environnement

A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.

Étape 2

Rédigez votre scénario

Saisissez un prompt - Le modèle comprend la physique, l'éclairage et l'intention émotionnelle de votre scène

Étape 3

Commencez à partager

Cliquez pour générer votre résultat final et téléchargez une vidéo de qualité professionnelle

Au-delà du prompt : un nouveau niveau de contrôle

PARALLAXE ORBITALE

PARALLAXE ORBITALE

Démontre la parallaxe multi-images de référence alors que la caméra glisse à travers une porte avec premier plan se déplaçant plus vite que l'arrière-plan. Démonstration architecturale cinématographique 16:9.

MÉTÉO CAUSALE

MÉTÉO CAUSALE

Met en lumière la physique causale : la pluie commence au milieu du clip, les gouttes créent des ondulations dans les flaques et assombrissent le pavé en séquence. Transformation atmosphérique cinématographique large.

BOUCLE CINEMAGRAPH

BOUCLE CINEMAGRAPH

Un cinemagraph fluide en boucle où la vapeur tourbillonne et les reflets néon scintillent tandis que tout le reste reste figé. Parfait pour ambiance paysagère en boucle infinie.

Comparer avec des modèles similaires

Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.

L'attente est enfin terminée

Découvrez la perfection avec Grok Imagine Video 1.5 Reference to Video

Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Foire aux questions

Vous pouvez inclure de une à sept images de référence dans une seule génération. Chaque image guide à la fois le style et le contenu de la vidéo, et vous pouvez pointer vers des spécifiques dans votre invite pour que le modèle sache exactement quel sujet ou aspect extraire de chacune.