Multimodal references to video
Gemini Omni Flash は、マルチモーダルのビデオ生成モデルで、参照素材を同期音声付きの短い動画に変換します。これを際立たせるのは、一度に多様な入力を組み合わせられる点です:欲しいものを記述したテキスト、被写体と外観を固定する参照画像、動き、スタイル、音を導くオーディオとビデオの手がかりを提供できます。これらの組み合わせた参照から、モデルは音声が焼き込まれた完成したビデオクリップを生成します — 後で音付けが必要な無音アニメーションではありません。
本質的に、Gemini Omni Flash は、記述プロンプトと1つ以上の参照画像を受け取り、両方を尊重した動画を生成します。テキストはモデルにストーリー、アクション、ムードを伝えます — 日当たりの良いリビングで猫が毛糸玉をじゃれつくようなもの — 参照画像は画面に表示したい実際の被写体、キャラクター、または美学を固定します。モデルが最大10枚の参照画像を受け付けるため、複数の視覚アンカーを提供でき、プロンプト内のインラインタグで各画像に特定の役割を割り当てられます。これにより、完成ショットでどの画像がどのキャラクターや要素になるかを正確に制御でき、偶然に任せません。
このモデルは、単なる動く画像以上のものを求めるクリエイター向けです。動画と同時にオーディオを生成するため、音と動きが連動する必要がある作品に最適 — スタイライズド変換やリップシンクが強みです。これにより、キャラクター主導のクリップ、表情豊かな会話シーン、ソース画像のスタイライズド再解釈、画面の出来事と音が同期する短いナラティブシーンに適しています。
誰が恩恵を受けるか?ソーシャルメディアクリエイターは、参照写真を音声付きの目を引くショートクリップに変換し、すぐに投稿可能。映画製作者やアニメーターは、本格制作前にキャラクターやセットの動きと音をテストするシーン原型を作成。デザイナーやマーケターは、製品ショットやブランド画像をスタイライズドモーション作品に変換。アニメキャラクターから表情豊かなアバターまでリップシンクコンテンツを作成する人は、口の動きと音声の同期能力を利用できます。自然言語プロンプトと自分の画像で出力制御するため、技術トレーニング不要で創造意図を反映した結果を得られます。
フォーマットと出力について、Gemini Omni Flash は2つの向きを選択可能:シネマティックやデスクトップ視聴に適したワイドスクリーン 16:9 ランドスケープフレーム、またはスマホやショートフォームソーシャルプラットフォーム向けの縦長 9:16 フレーム。動画はデフォルト8秒で、3〜10秒の範囲で設定可能、プロジェクトに応じてクイックループややや長いビートに調整。動画は 720p で生成され、ほとんどのオンライン用途に適したクリーンで共有可能な解像度です。すべての生成物は音声付きダウンロード可能なビデオファイルとして返されます。
クリエイティブコントロールとして、いくつかのレバーが用意されています。テキストプロンプトが主な操舵輪 — 被写体、アクション、設定、ムード、欲しい音を記述。プロンプトフィールドは寛大で、数語のキーワードではなく詳細な記述的方向性を書けます。参照画像はシーンの視覚アイデンティティを制御し、特定の画像を特定の役割にバインドする機能で、どの参照がどの要素になるかを精密に指定。アスペクト比設定で出力先をマッチさせ、duration設定でペースと長さを制御。これらで、自分のアセットから始まり、意図した見た目と音の動画で終わるワークフローが実現します。
モデルがテキストと静止画だけでなくオーディオとビデオを入力として受け付ける点が、柔軟性の核心です。既存の音声や映像を混ぜて最終クリップの動きや音をガイドでき、変換スタイルの作品の扉を開きます:重要な要素を保持しつつ既存素材を新しいスタイルで再構築。このマルチモーダルアプローチがモデルの定義的特徴で、スタイライズド変換やリップシンクワークフローに分類される理由です。
実践的な考慮点として、クリップは設計上短く、3〜10秒の範囲がソーシャル投稿、ループ、イントロ、リアクションモーメント、クイックシーン teste に最適で、長形式シーケンスには不向きです。明確で具体的なプロンプトを書くこと、被写体とスタイルを明確に表す参照画像を選ぶことで最適結果を得られます。複数参照時は役割バインドタグを活用して各画像の使い方をモデルに伝えます。プロンプトに加え最低1枚の参照画像が必要なため、参照駆動型ツール — 空白から始めるより視覚素材から構築する際に輝きます。
要するに、Gemini Omni Flash は、テキスト、画像、オーディオ、ビデオを同期音声付き短いクリップに組み合わせる参照-to-ビデオ モデルで、被写体、動き、スタイル、オーディオを制御、ワイドスクリーンと縦フレーム両対応、3〜10秒のクリップ長設定可能。自分の画像をスタイライズドで音付き動画に変換したいクリエイターや、リップシンク・キャラクター駆動の短いコンテンツ作成者に強力な選択肢です。
Add the image that you want change
ルックやキャラクター、環境をガイドする画像を任意で追加できます
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
プロンプトを入力 - モデルがシーンの物理、ライティング、感情的な意図を理解します
クリックして最終出力を生成し、プロダクション品質の動画をダウンロードします
大気的な動きと生成自然環境音でシネマティック ランドスケープ アニメーションをデモし、ワイドフォーマットストーリーテリングを実現します。
参照画像にダイナミック照明と音を組み合わせ、ラグジュアリー商用リール向けプレミアム製品アニメーションを披露します。
“Animate as a smooth 360-degree rotation on an invisible turntable. Rotate slowly and continuously, taking 6 seconds for full rotation. Light reflections should shift naturally across the metal case and crystal. Maintain consistent dramatic lighting throughout rotation. Add subtle sparkle on diamond indices as they catch light. Keep the background static and dark. Professional product video quality.”
今すぐ推論ガイド型の生成に切り替えましょう

Animate images into cinematic video
0.6クレジット

Cinematic video from images fast
0.1クレジット

Animate images into video with audio
10クレジット

Animate image to 1080p video
2.8クレジット
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2クレジット

Cinematic video from images
10クレジット

Animate images into 2K video
7.8クレジット

Video from image, audio references
0.4クレジット