Video from image, audio references
Grok Imagine Video 1.5 Reference to Videoは、xAIが開発したモデルで、参照画像とオプションのオーディオトラックを完全にアニメーション化されたビデオに変換します。単一のフレームから始めるのではなく、このモデルでは最終クリップの外観と内容の両方をガイドする一連の画像を入力でき、それらを動き、ムード、アクションを記述したテキストプロンプトと組み合わせます。結果は、あなたが提供した視覚世界から直接引き出された短いビデオで、アートワーク、写真、商品ショット、ムードボードをすでに持っていて、それらを動きに変えたいクリエイターに最適です。
最大の特徴はマルチイメージ参照です。1〜7枚の参照画像を提供でき、モデルはそれらをスタイルと内容のガイドとして一緒に使用します。プロンプトでは各画像を個別に指定し、モデルにピースの関連付け、ブレンド、トランジションを正確に指示します。これにより、「これら3枚の画像を使って場所を発見し、クールなモーショングラフィックスを作成」といったシーンを記述でき、モデルがそれらを一貫したシーケンスに織り交ぜます。キャラクター、背景、テクスチャ、カラーパレット、または同一サブジェクトの3つのバリエーションを入力する場合でも、モデルは各参照をビルディングブロックとして扱います。
オーディオも主要な入力です。1つの参照オーディオクリップを添付し、プロンプトで画像と一緒に参照できます。これにより、画像の人物がオーディオトラックの声で話すなど、話されたパフォーマンスやサウンドを視覚と同期させるプロンプトが可能になります。画像とオーディオの両方をプロンプトで直接タグ付けできるため、各要素が完成ビデオにどのように寄与するかを細かく制御できます。
出力ビデオは24fpsで生成され、解像度は2種類から選択:クイックテストやドラフト用の軽量480p、より洗練された結果用のシャープな720pです。長さは1秒から最大15秒まで柔軟に調整可能で、クイックループから長いシーンまで作成できます。サンプル出力は1280x720のフルクリップで10秒強、24fpsで動作し、1回の生成で達成可能な長さと滑らかさを示しています。
アスペクト比のサポートは幅広く、シネマティックやランドスケープ用のワイドスクリーン16:9、縦型ソーシャル形式用の9:16、フィード用のスクエア1:1、その間のクラシック比として4:3、3:2、2:3、3:4をカバーします。この範囲により、プラットフォームやプロジェクトに必要なフレームを正確にターゲットでき、後からクロップせずに縦型ショート、スクエア広告、ワイドスクリーンのシーンを作成できます。
クリエイティブコントロールはシンプルです。テキストプロンプトが主な役割を果たし、動きとストーリーを記述しつつ参照画像とオーディオを指定します。参照画像の枚数と順序、希望の長さ、解像度、アスペクト比を選択します。プロンプトは詳細に記述可能で、豊富なテキスト量をサポートするため、画像の組み合わせ方、動きの対象、シーンの時間的進化を具体的に指定できます。
誰が最も恩恵を受けるか? 映画製作者やビデオクリエイターはコンセプトアートやロケーションフォトを入力しアクションを記述してシーンを素早くプロトタイプ化できます。デザイナーやモーショングラフィックスアーティストは静的構成をアニメーション化し、複数のビジュアルアセットを1つのムービングピースにブレンドできます。ショートフォーム縦型ビデオを作成するコンテンツクリエイターは、数枚の画像を正しいアスペクト比の投稿準備完了クリップに変換できます。マーケティングや製品チームは静止商品ショットを記述的なモーションプロンプトで命を吹き込めます。ゼロから始めるのではなく既存のビジュアルライブラリから作業する人は、参照駆動型ワークフローが特に効率的で、最終ビデオを既存のルックに固定します。
実用的考慮点として、モデルは少なくとも1枚の参照画像とテキストプロンプトを必要とし、1回の生成あたり最大7枚の画像と1つのオーディオクリップを受け付けます。画像がスタイルと内容のガイドとして機能するため、画面に欲しいものを明確に表すクリーンでよく構成された参照を選択すると最も予測可能な結果が得られます。プロンプトで各画像を明示的にタグ付けすると組み合わせ方を最も明確に制御できます。このモデルは商用利用が承認されており、クライアントワークや公開プロジェクトに適します。生成サービスと同様、リクエストはxAIの利用規約を遵守する必要があります。
要するに、Grok Imagine Video 1.5 Reference to Videoは、特定のソース画像に忠実でありながら動きを追加し、オプションで声やサウンドを加えたいクリエイター向けに構築されています。マルチイメージ参照、オーディオ入力、最大15秒の柔軟な長さ、2種類の解像度、豊富なアスペクト比を組み合わせ、既存の大切なビジュアルをアニメーション化する集中型で制御可能な方法を提供します。
Add the image that you want change
ルックやキャラクター、環境をガイドする画像を任意で追加できます
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
プロンプトを入力 - モデルがシーンの物理、ライティング、感情的な意図を理解します
クリックして最終出力を生成し、プロダクション品質の動画をダウンロードします
カメラがドアを通り抜け、前景が背景より速くシフトするマルチ画像参照パララックスを実演。シネマティック16:9アーキテクチャショーケース。
因果物理を強調:クリップ中盤で雨が始まり、水滴が水たまりの波紋を響かせ舗装を順次暗くする。シネマティックワイドアトモスフェリック変容。
シームレスループ対応シネマグラフで蒸気が渦巻きネオン反射がきらめく一方、他は凍結。無限ループ風景アンビエンスに最適。
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
今すぐ推論ガイド型の生成に切り替えましょう

Cinematic video from images
10クレジット
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2クレジット

Animate images into cinematic video
0.6クレジット

Multimodal references to video
10クレジット

Animate images into 2K video
7.8クレジット

Cinematic video from images fast
0.1クレジット

Animate images into video with audio
10クレジット

Animate image to 1080p video
2.8クレジット