Multimodal references to video
Gemini Omni Flash est un générateur vidéo multimodal qui transforme votre matériel de référence en vidéos courtes complètes avec audio synchronisé. Ce qui le distingue, c'est la diversité des entrées qu'il peut combiner simultanément : vous pouvez lui fournir un texte décrivant ce que vous voulez, des images de référence pour fixer les sujets et l'apparence, plus des indications audio et vidéo pour guider le mouvement, le style et le son. À partir de ces références combinées, le modèle produit un clip vidéo fini avec son intégré — pas une animation silencieuse que vous devriez sonoriser après coup.
Au cœur de Gemini Omni Flash, il fonctionne en prenant un prompt écrit accompagné d'une ou plusieurs images de référence pour générer une vidéo qui respecte les deux. Le texte indique au modèle l'histoire, l'action et l'ambiance recherchées — comme un chat jouant avec une pelote de laine dans un salon ensoleillé — tandis que vos images de référence ancrent les sujets réels, personnages ou esthétique que vous voulez voir à l'écran. Comme le modèle accepte jusqu'à dix images de référence, vous pouvez fournir plusieurs points d'ancrage visuels et même assigner à chacune un rôle spécifique dans votre scène à l'aide de balises en ligne dans votre prompt, afin qu'une image particulière devienne un personnage ou un élément précis dans le plan final. Cela vous donne un contrôle significatif sur l'identité exacte des éléments qui apparaissent, plutôt que de laisser au hasard.
Le modèle est conçu pour les créateurs qui veulent plus qu'une simple image en mouvement. Comme il génère l'audio en même temps que la vidéo, il est parfaitement adapté aux travaux où le son et le mouvement doivent être connectés — les transformations stylisées et la synchronisation labiale font partie de ses forces. Cela en fait un choix naturel pour les clips centrés sur des personnages, les scènes parlées expressives, les réinterprétations stylisées de vos images sources, et les moments narratifs courts où le son doit correspondre à l'action à l'écran.
Qui en bénéficie ? Les créateurs de contenus pour réseaux sociaux peuvent transformer des photos de référence en clips courts accrocheurs avec audio intégré, prêts à poster. Les réalisateurs et animateurs peuvent prototyper des scènes et tester le mouvement et le son d'un personnage ou d'un décor avant de s'engager dans une production complète. Les designers et marketeurs peuvent métamorphoser des photos de produits ou des visuels de marque en pièces animées stylisées. Quiconque travaille sur du contenu lip-sync — des personnages animés aux avatars expressifs — peut s'appuyer sur la capacité du modèle à aligner le mouvement des lèvres et la parole. Et comme vous guidez la sortie avec des prompts en langage naturel plus vos propres images, aucune formation technique n'est nécessaire pour obtenir des résultats reflétant votre intention créative.
Concernant les formats et sorties, Gemini Omni Flash vous propose deux orientations : un cadre paysage large 16:9 adapté au visionnage cinématographique et desktop, et un cadre vertical haut 9:16 conçu pour les mobiles et les plateformes sociales courtes. Les vidéos font 8 secondes par défaut et peuvent être réglées de 3 à 10 secondes, pour un loop rapide ou un rythme un peu plus long selon les besoins de votre projet. Les vidéos sont produites en 720p, offrant une résolution nette et partageable pour la plupart des usages en ligne. Chaque génération est renvoyée sous forme de fichier vidéo téléchargeable avec son inclus.
Pour les contrôles créatifs, vous disposez de plusieurs leviers. Votre prompt texte est le volant principal — il décrit le sujet, l'action, le décor, l'ambiance et le son souhaités. Le champ de prompt est généreux, vous laissant ample place pour des directions détaillées et descriptives plutôt que quelques mots-clés. Vos images de référence contrôlent l'identité visuelle de la scène, et la possibilité d'associer des images spécifiques à des rôles précis vous permet d'être exact sur quel référence devient quel élément. Le réglage du ratio d'aspect adapte votre sortie à sa destination, et le réglage de durée contrôle le rythme et la longueur. Ensemble, ces outils forment un workflow qui part de vos propres assets pour aboutir à une vidéo qui ressemble et sonne comme vous l'avez imaginé.
Le fait que le modèle accepte l'audio et la vidéo comme entrées — pas seulement du texte et des images fixes — est au centre de sa flexibilité. Vous pouvez intégrer du son et des séquences existantes pour guider le mouvement et le son du clip final, ce qui ouvre la porte à des travaux de transformation : réimaginer du matériel existant dans un nouveau style tout en conservant les éléments qui comptent. Cette approche multimodale est la caractéristique définissante du modèle et la raison pour laquelle il est associé aux workflows de transformation stylisée et de lip-sync.
Quelques considérations pratiques. Les clips sont courts par conception — la plage de 3 à 10 secondes rend le modèle idéal pour les posts sociaux, loops, intros, moments de réaction et tests de scènes rapides plutôt que des séquences longues. Vous obtiendrez les meilleurs résultats avec des prompts clairs et spécifiques, et en choisissant des images de référence qui représentent nettement les sujets et le style souhaités, car ces images portent l'identité visuelle. Avec plusieurs références, utiliser les balises de liaison de rôles aide le modèle à comprendre précisément comment utiliser chaque image. Et comme au moins une image de référence est requise avec votre prompt, c'est un outil piloté par références — il excelle quand vous avez déjà du matériel visuel de base plutôt que de partir de zéro.
En résumé, Gemini Omni Flash est un modèle de référence vers vidéo qui combine texte, images, audio et vidéo en clips courts avec son synchronisé, offre un contrôle sur le sujet, le mouvement, le style et l'audio, supporte les cadrages large et vertical, et permet de régler la durée des clips de 3 à 10 secondes. C'est un excellent choix pour les créateurs qui veulent transformer leurs images en vidéos stylisées avec son, et pour tous ceux qui travaillent sur du lip-sync et du contenu court centré sur des personnages.
Add the image that you want change
Ajoutez une image facultative pour guider le style, le personnage ou l'environnement
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Saisissez un prompt - Le modèle comprend la physique, l'éclairage et l'intention émotionnelle de votre scène
Cliquez pour générer votre résultat final et téléchargez une vidéo de qualité professionnelle
Démontre animation paysage cinématographique avec mouvement atmosphérique et son ambiant nature généré pour narration large format.
Met en valeur animation produit premium combinant images de référence, éclairage dynamique et son pour reels commerciaux luxury.
“Animate as a smooth 360-degree rotation on an invisible turntable. Rotate slowly and continuously, taking 6 seconds for full rotation. Light reflections should shift naturally across the metal case and crystal. Maintain consistent dramatic lighting throughout rotation. Add subtle sparkle on diamond indices as they catch light. Keep the background static and dark. Professional product video quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Cinematic video from images
10 crédits

Animate images into cinematic video
0.6 crédits

Animate images into 2K video
7.8 crédits

Cinematic video from images fast
0.1 crédits
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 crédits

Animate images into video with audio
10 crédits

Animate image to 1080p video
2.8 crédits

Video from image, audio references
0.4 crédits