Text to video with audio
LTX-2.3 22B 能將單一書面提示轉換為完整的影片片段,並附帶同步音訊。相較於先生成無聲片段再尋找音效或音樂後製疊加,您只需描述想要的場景,模型便會一次過交付動態影像與匹配音效。這使其非常適合電影製作者快速製作預視化、內容創作者製作短社群影片、動態設計師探索構想,以及任何希望看到概念動起來並發出聲響的藝術家,而無需操作時間軸。
模型核心是讀取您的文字提示並據此建構影片。好的提示不僅描述畫面內容,還包括感覺——例如「一名牛仔在正午塵土飛揚的小鎮行走,鏡頭從後方跟拍,電影感景深,寫實燈光,西部氛圍,4K 膠片顆粒。」您越詳細描述氛圍、燈光、鏡頭行為和質感,結果就越接近您的想像。模型也能自動擴充提示,填補電影細節,讓較短描述產生豐富一致的鏡頭。
您可廣泛控制片段的形狀與長度。影片可從短暫的 9 幀時刻到 481 幀,幀率從 1 到 60 幀/秒皆可,預設為 24 幀/秒——經典電影節奏。預設片段為 121 幀的 16:9 橫幅畫面,適合寬銀幕與社群影片,但您可選擇其他畫幅匹配專案。播放速度與長度互動,低幀率長幀數產生較慢拉長時刻,高幀率則提供更流暢動作。
其中一項突出創作工具是直接鏡頭控制。不必寄望模型解讀「推近主體」等描述,您可從真實鏡頭移動中選擇:dolly in、dolly out、dolly left、dolly right、jib up、jib down,或固定靜態鏡頭。這些提供電影製作者依賴的精準、可重複鏡頭語言,您可調整移動強度,使其細膩或戲劇化。這讓您更容易獲得支持故事的有意動作,而非隨機漂移。
音訊預設隨影片生成,若只需無聲畫面可關閉。您也有獨立控制旋鈕,調整音訊與影片各自忠於提示的程度,以及兩者平衡——當您想讓音景突出或專注視覺時非常實用。
為提升整體一致性與細節,模型採用多尺度方法。先以小尺度草稿影片,再用其引導較大更細緻的最終渲染。結果比單次全尺寸生成更一致且細節乾淨。您可進一步調整模型追隨提示與創作自由度的平衡、精煉程度(速度與拋光間權衡),並使用控制變異選項提升難景品質。
負面提示讓您避開不想要的外觀。預設避開卡通、電玩美學、畫面文字、水印、logo、字幕、慢動作及靜態平面畫面——引導結果朝更電影化真人感。您可依自家美學重寫。
輸出格式有多種適合工作流程:標準 MP4、WebM、高階編輯 ProRes,或輕量分享動畫 GIF。品質從低到最高,您可偏向快速寫入、小尺寸或平衡中間值。加速設定讓您在生成速度與保真間權衡,視快速迭代或最終英雄鏡頭而定。
為確保重現性,您可設定種子,讓相同提示與參數產生相同結果——適合小幅控制變更而非每次從頭開始。內建安全檢查預設啟用。
LTX-2.3 22B 最適短篇電影影片:氛圍片、概念鏡頭、社群短片、動畫分鏡及想法探索,內建同步音訊省去整個編輯步驟。因片段以幀計量並生成自成一體時刻,擅長單一具感染力的鏡頭,而非長篇多景敘事。最大化利用在於撰寫具描述性的電影提示、選擇有意鏡頭移動,並讓多尺度渲染與精煉發揮作用。以提示驅動影片、原生音訊及精準鏡頭控制的組合,為創作者提供從書面構想到動聽場景的快速途徑。
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
描述您的影片場景,包含動態、鏡頭角度與氛圍
模型以自然的物理與光線打造電影般的動態效果
下載並分享可直接上線的影片
展示持續追蹤動作、車輛動態及引擎音訊生成,在寬銀幕電影序列中建構適合 YouTube 和電影。
示範大氣霧氣動態、燈光轉換及沉浸自然音訊,適合 Netflix 風格紀錄片景觀內容。
強調模型同步音視生成,含群眾聲、大氣舞台燈光及活力鏡頭動作,適合橫幅電影。
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
立即切換至推理引導式合成

Film-grade video with audio
0.1 點數

Text to video with audio
0.3 點數

Cinematic video with native audio
1.4 點數

Cinematic video from references
10 點數

Cinematic video from references
0.4 點數
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 點數

Fast cinematic video with audio
0.1 點數

Fast balanced text-to-video generation
1.6 點數

Frontier 2K text-to-video generation
7.3 點數