Video from image, audio references
Grok Imagine Video 1.5 Reference to Videoは、xAIの画像から動画モデルで、参照画像と記述したプロンプトをアニメーション付きの動画クリップに変換します。ゼロから始めるのではなく、モデルに1つ以上の参照画像を入力し、望むシーンを記述して、参照画像のスタイルとコンテンツを維持した動きを生成させ、完成した動画を作成します。
このモデルの特徴は参照画像の使い方にあります。1〜7枚の参照画像を提供でき、モデルはそれらをスタイルとコンテンツのガイドとして扱います。プロンプト内で<IMAGE_0>、<IMAGE_1>などの簡単なタグを使って特定の画像を指定します。例えば「<IMAGE_0>の人物が雨のネオン街を歩く」といった指示を書くことで、モデルはどの主題やスタイル要素をどの画像から引き出すかを正確に理解します。このタグシステムにより、複数の視覚ソースを1ショット内で精密に組み合わせることができ、1枚の画像のキャラクターを他の画像の設定やスタイル内に配置する際に特に便利です。
このモデルはスタイライズされた変形的作品向けに構築されており、リップシンク機能も備え、キャラクターやポートレートを表情豊かで協調した動きで命を吹き込むのに適しています。画像、オーディオ、テキスト入力をすべて受け付けるため、見た目を決める画像、動作を記述するテキスト、タイミングや口の動きをガイドするオーディオを同時にレイヤリングできます。出力は常に動画ファイルで、編集に挿入したり直接共有したりするのに即準備完了です。
クリエイティブプロフェッショナルは、最终クリップのフレーミングとペーシングに豊富な柔軟性があります。アスペクト比は幅広い選択肢から選べ、シネマティックやデスクトップ視聴向けのワイドスクリーン16:9、ReelsやStoriesなどの縦型ソーシャルフォーマット向けの9:16、フィード向けの正方形1:1、その中間オプションとして4:3、3:2、2:3、3:4などです。これにより、クロップやリフォーマットなしで目的のプラットフォームやレイアウトにぴったりの動画を生成できます。動画長も調整可能で、1秒から15秒まで、クイックループ、短いシーン、長めのシーケンスなどプロジェクトに合わせて作成可能です。
出力品質では、軽量で高速なクリップ向けの480pと、よりシャープで高精細な結果向けの720pの2つの解像度を選択できます。出力例は24fpsで動作し、滑らかでフィルムライクな動きを提供します。720pのワイドスクリーンは1280x720ピクセルで、ほとんどのオンラインやプレビュー用途に適しています。
このモデルで最も恩恵を受けるのは誰か? アーティストやイラストレーターは既存のアートワークやキャラクターデザインをアニメーション化し、静止画が動き出し演技します。デザイナーは参照ボードやムード画像を動くコンセプトピースに変換。映画製作者や動画クリエイターは主題を記述した環境と組み合わせ、フルプロダクション前にクイックなプレビジュアライズクリップを生成。ソーシャルプラットフォームで活躍するコンテンツクリエイターは参照画像を縦型、正方形、ワイドスクリーンフィードにぴったりの短いスタイライズド動画に変換できます。リップシンク対応により、話すキャラクター、アバター、ナレーション付きショートを作成する人はポートレートにオーディオを組み合わせ、同期したパフォーマンスクリップを作れます。
最適な結果を得るには、丁寧なプロンプティングが鍵です。モデルは参照画像とテキスト記述の両方を読み取るため、動作を明確に記述し適切な画像をタグ付けすることで、何がどう動くかを正確に理解させます。複数参照を使う場合、各画像に役割を割り当て(例: キャラクター用と環境/スタイル用)、構成を一貫させます。最大7枚まで組み合わせ可能で豊かなレイヤーシーンを構築できますが、焦点を絞った参照セットと明確なプロンプトで最もクリーンで制御しやすい結果が得られます。
いくつかの実用的考慮点も念頭に。生成ごとに最低1枚の参照画像とテキストプロンプトが必要です。テキストのみからの生成ではなく視覚参照で出力誘導する設計のためです。解像度は720pが上限で、大型高解像度仕上げではなくスタイライズド、変形的、ソーシャル向け動画を対象とします。クリップ長は15秒上限で、ショートフォームストーリーテリング、ループ、ソーシャルコンテンツに適します。その範囲内で、複数画像参照、柔軟なフレーミング、調整可能長、リップシンクの組み合わせが、静止画像を表現力豊かな動きに変える汎用ツールを提供します。
要するに、Grok Imagine Video 1.5 Reference to Videoは、参照駆動型アニメーションツールで、画像を動画に変えるプロセスをクリエイターが直接制御できます。プロンプト内で特定参照をタグ付け、多様なアスペクト比を選択、長さと解像度を調整、オーディオに口の動きを同期させることで、創造的決定をユーザーに委ねつつ動き生成を担います。
Add the image that you want change
ルックやキャラクター、環境をガイドする画像を任意で追加できます
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
プロンプトを入力 - モデルがシーンの物理、ライティング、感情的な意図を理解します
クリックして最終出力を生成し、プロダクション品質の動画をダウンロードします
複数画像参照のパララックスを実演。カメラがドア通過中、前景が背景より速くシフト。シネマティック16:9アーキテクチャショーケース。
因果物理を強調: クリップ中盤で雨開始、水滴が puddle ripplesを起こし舗装を順次暗く。シネマティックワイド大气変形。
シームレスループ対応シネマグラフ。蒸気が渦巻きネオン反射がきらめき、他は凍結。無限ループ風景アンビエンスに最適。
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
今すぐ推論ガイド型の生成に切り替えましょう

Multimodal references to video
10クレジット

Cinematic video from images
10クレジット

Animate images into 2K video
7.8クレジット

Cinematic video from images fast
0.1クレジット

Animate images into cinematic video
0.6クレジット

Animate images into video with audio
10クレジット
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2クレジット

Animate image to 1080p video
2.8クレジット