Text to video with audio
xAI が開発した Grok Imagine Video 1.5 (Text to Video) は、記述されたプロンプトを音声付きの短いビデオクリップに変換します。ビジュアルとサウンドのために別々のツールを組み合わせる代わりに、欲しいシーンを平易な言葉で記述するだけで、モデルがモーションと独自のオーディオトラック付きの完成クリップを生成します。これにより、クリエイターはカメラ、俳優、編集スイートなしでアイデアをテストし、ソーシャルコンテンツを作成し、ムービングイメージをプロトタイプする高速で自己完結型の方法となります。
このモデルの核心は、テキスト記述を読み取り、主語とその動き方を解釈することです。「日当たりの良い庭を横切る蝶を追う白い子猫、穏やかなカメラトラッキング、自然な動き、葉っぱを通る柔らかな午後の光」というプロンプトは、モデルに必要なすべてを提供します:主語、動作、カメラの挙動、照明のムード。このような詳細で映画的な指示に応じるため、画面に表示されるものだけでなく、カメラの挙動や光の当たり方をコントロールできます。サンプルプロンプトは、アニメや少女漫画の美学をスピードライン、桜の花びら、鮮やかな色、表情豊かなキャラクターで扱うスタイライズドな作品も高速で処理することを示しており、フォトリアリスティックからイラスト風まで柔軟に対応します。
各クリップの長さを1〜15秒の範囲でコントロールできます。短いクリップはクイックループ、リアクション、ソーシャルスニペットに最適で、長めのものは完全なビートや小さなナラティブの瞬間に適します。デフォルト長は約6秒で、ほとんどのシングルショットアイデアに適しています。出力は24 frames per secondで再生され、モーションに滑らかでフィルムのようなリズムを与えます。
解像度は3段階で調整可能:高速ドラフトと粗テスト用の480p、日常標準の720p、仕上げ作品向けの最も鮮明で詳細な1080pです。これにより、低解像度でプロンプトを素早く調整し、方向性が決まったら高品質でクリーンな最終バージョンを生成できます。
アスペクト比は完全に柔軟で、ビデオが配置される場所に合わせた幅広い形状に対応します。横型再生用のクラシックな16:9、スマホ優先フィードやストーリー用の縦型9:16、グリッド投稿用の正方形1:1、その中間比として4:3、3:2、2:3、3:4を生成できます。同じプロンプトから縦横どちらもフレーミングできるため、同じアイデアを複数プラットフォーム向けに自然にフィットします。
際立った機能の一つがネイティブオーディオです。別途スコアリングやフォーリーを追加する無音クリップではなく、Grok Imagine Video 1.5 は同時にオーディオトラック付きビデオを生成します。これによりテキストプロンプトが完成した瞬間に近づき、クイックコンセプト、ムードテスト、音がインパクトを大きくするソーシャルコンテンツに特に有用です。
プロンプトフィールドは寛大で、数千文字までの長く詳細な記述を受け付けます。この余裕は具体性を報酬します:主語、動作、カメラムーブメント、照明、カラーパレット、アートスタイル、ムードを一括でレイヤリングできます。サンプルプロンプトが示すように、「穏やかなカメラトラッキング」「柔らかな午後の光」「急ぎを表すスピードライン」や特定の美学名を指定すると、モデルに明確な指示を与え、意図に近い結果を生みやすくなります。
このモデルは幅広いクリエイティブプロフェッショナルに適しています。ソーシャルメディアクリエイターやマーケティング担当者は、目を引く縦型や正方形クリップを素早く作成できます。映画製作者やアニメーターは、ショットをプレビジュアライズし、カメラムーブをブロックし、本格制作前にルックを探求できます。イラストレーターやデザイナーは、スタイライズドな世界をモーションとサウンドで具現化できます。コンセプトアーティストやストーリーテラーは、ムード、ペーシング、ビジュアルアイデアを高速でテストし、比較用のバリエーションを複数生成できます。テキスト駆動でソース映像不要のため、従来の撮影に機材や予算がない人でもムービングイメージを作成しやすくなります。
いくつかの実践的な考慮点を念頭に置いてください。モデルはテキストのみから動作し、画像や参照入力はありません。すべて記述から生成されるためシンプルですが、プロンプトの明瞭さと詳細が主な役割を果たします;曖昧なプロンプトは詳細に記述したものより一般的な結果になります。クリップ長は15秒上限なので、ショートフォームの瞬間やシングルショット向けで、長連続シーケンスではなく、複数クリップを生成して長く組むことは可能です。要請は xAI の使用条件に従います。
全体として、Grok Imagine Video 1.5 (Text to Video) は、言葉のアイデアから音声付き短いビデオへの多用途で自己完結型の方法です。最大15秒の調整可能長さ、1080pまでの3段階解像度、幅広いアスペクト比、滑らかな24fpsモーション、内蔵オーディオにより、クイックソーシャル実験から洗練されたコンセプトピースまで柔軟な起点を提供します。
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
動き、カメラアングル、ムードを含めて動画のシーンを説明します
モデルが自然な物理とライティングでシネマティックな動きを生成します
プロダクション品質の動画をダウンロードしてシェアしましょう
不可能なワンショットFPVドローンムーブでアグレッシブなカメラコントロールを披露、連続モーションとダイナミックスケールのコマンドをワイドスクリーンで証明。
モデルのリアリズムを活かしたフェイクボディカムアブサードコメディに同期対話を活用、デッドパン本物らしさでバイラル設計のフォーマット。
加速ハイパーラプスと連続光跡ダイナミクスで精密カメラコントロールと時間的モーションを実演、16:9ヒーロークリップに最適なシネマティック。
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
今すぐ推論ガイド型の生成に切り替えましょう

Fast cinematic video with audio
0.1クレジット

Fast balanced text-to-video generation
1.6クレジット

Cinematic video from references
10クレジット
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2クレジット

Frontier 2K text-to-video generation
7.3クレジット

Cinematic video from references
0.4クレジット
Text to video with audio
0.7クレジット

Cinematic video with native audio
1.4クレジット

Film-grade video with audio
0.1クレジット