Multimodal reference-guided 2K video
Hailuo 03 Reference to Video はMiniMaxによる最先端のビデオ生成モデルで、多様なリファレンスを洗練された2Kビデオに変換します。最大の特徴は、複数種類のガイダンスを同時に取り込める点です。被写体やスタイルのために最大9枚のリファレンス画像、動きを指定するために最大3本の動画クリップ、さらに最大3本のオーディオクリップを、1つのプロンプトで組み合わせることができます。各リファレンスはプロンプト内でタイプと順序を指定することで引用され、「Image 1をロックキャラクターとして使う」「Video 1のテンポに従う」のように詳細なコントロールが可能です。
このモデルは一貫性を大切にするクリエイターのために設計されています。キャラクターやオブジェクトをリファレンス画像に“ロック”すると、Hailuo 03は髪型、衣装、小物、カラーパレットまで忠実に保ったまま、その被写体をビデオの中で一貫して描写します。これにより、映画的なシーンで同じキャラクターが複数カットにわたって安定して登場する必要がある場合や、ブランドのマスコット、主人公の動物など、ストーリーテリング用途に非常に適しています。複数の被写体を同時にリファレンスできるため、個性的なキャラクターが複数登場するシーンでも、それぞれが自分のリファレンス通りに表現されます。
動きのリファレンスはさらにコントロールの幅を広げます。短い動画クリップを指定することで、テキストだけでは伝えきれなかった動作やカメラワーク、テンポを直接モデルに指示できます。特定のアクションやカメラワークを正確に再現させたい場合、プロンプトだけに頼るよりもはるかに直感的です。オーディオリファレンスを加えれば、サウンドとビジュアルを紐づけた一体的な演出を可能にします。ただし、オーディオだけをリファレンスとして使用することはできず、必ず画像か動画が最低ひとつ必要です。
Hailuo 03は2K解像度で出力され、シネマティックかつ高品質な映像を実現します。アスペクト比も21:9のウルトラワイド、16:9の標準、1:1のスクエア、9:16や3:4などの縦型フォーマット、さらに素材に合わせた自動調整も可能です。ワイド映画のカット、スクエアなSNS投稿、縦型モバイル動画まで、用途に合わせて柔軟に対応します。クリップ長は5秒から15秒まで調整でき、短い一拍からしっかり構成のあるシーケンスまで自由度があります。
例示されるプロンプトでは、高品質な4K風の中国神話的3Dシーンや、絵コンテ通りのシネマティックな演出、なめらかなカメラワークや自然なトランジションなど、要求レベルの高いビデオ生成が実現されています。顔をクローズアップだけで見せたり、ワイドショットで背中や3/4アングルを指示するなど、細かいカット指示にも応えられる柔軟さがあります。プロンプトを精密かつ構造的に書き込むほど、構成やリズム、フレーミングへの反映度が高まります。
特に恩恵を受けるのは、一貫性の高いキャラクターやカメラ制御を求める映像作家やアニメ監督です。コンセプトアーティストやデザイナーは、1枚のリファレンス画像から独自のアニメーションルックを確保できます。連続ものやシリーズ作品のクリエイターは、登場キャラクターを複数クリップに渡って維持しやすくなります。スタイライズド3D、シネマティック、ストーリー主導の動画制作において、スタイルリファレンス、動きのリファレンス、精度の高いプロンプトがクリエイティブなビジョンを形にする強力な武器となります。
ベストな結果を得るためには、プロンプトを“カット割リスト”のように扱ってください。被写体やリファレンスごとの役割と守るべきディテールを明確に表示し、絵コンテの順番、リズム、カメラの動き、フレーミングまで記述しましょう。モデルは引用順でリファレンスを参照するため、整理され具体的なプロンプトほど、狙い通りの統一感あるシネマティックなシーケンスを生成します。動画や音声リファレンスは2〜15秒程度の短いものを推奨・合計時間にも上限があるので、動きや音を代表するクリップを選んでください。現時点では2K解像度のみ対応ですが、これによりプロジェクト間で常に高い品質を保てます。
要するに、Hailuo 03 Reference to Videoは“テキストだけにとどまらない”クリエイターのためのマルチモーダル動画生成モデルです。画像・動画・音声を統合し、被写体の一貫性・動きの再現・細やかな演出を両立し、ストーリー重視の野心的な映像制作に最適なコントロール性能を提供します。
Add the image that you want change
ルックやキャラクター、環境をガイドする画像を任意で追加できます
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
プロンプトを入力 - モデルがシーンの物理、ライティング、感情的な意図を理解します
クリックして最終出力を生成し、プロダクション品質の動画をダウンロードします
Animate as a smooth camera push-in through the space. Start wide to show full room, then slowly dolly forward toward the windows. Subtle light flicker from fireplace casts dancing shadows. Curtains sway gently from air circulation. City lights outside twinkle. Ambient dust particles float in window light. Camera maintains steady smooth motion throughout. Reveal more of the city view as camera approaches windows. 6 seconds, cinematic quality.
Animate the lion with natural resting behavior. Gentle breathing visible in chest movement. Ears twitch and rotate listening to surroundings. Eyes blink slowly and scan the horizon. Mane fur ruffles slightly in savanna breeze. Tail flicks occasionally. Background grass sways in wind. Subtle heat shimmer in distant air. Maintain majestic, powerful presence. 6 seconds, National Geographic documentary quality.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
今すぐ推論ガイド型の生成に切り替えましょう

Cinematic video from images fast
0.1クレジット

Cinematic video from images
10クレジット

Animate images into 2K video
6.3クレジット

Animate images into cinematic video
0.6クレジット

Animate image to 1080p video
2.8クレジット

Multimodal references to video
10クレジット
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2クレジット

Animate images into video with audio
10クレジット