Text to video with audio
LTX-2.3 22B 能将单个文字提示转化为完整的视频片段,并且自动同步音频。无需先生成无声画面再为其寻找配乐或音效,你只需描述你想要的场景,模型即可一次性生成画面与音效同步的视频。无论是电影人快速制作前期可视化、内容创作者产出短小社交视频、动态设计师探索新思路,还是任何希望看到自己的想法动起来、听得见而无需剪辑时间线的创作者,这都是强大的工具。
核心原理是模型读取你的文本提示,并据此生成视频。优秀的提示不仅描述了画面中的内容,还能讲述整体氛围——比如:“正午时分,一名牛仔穿过尘土飞扬的小镇,镜头从背后跟随,具备电影感景深,真实光线,西部氛围,4K胶片颗粒感。”你描述得越多,比如氛围、光影、机位动作与质感,生成结果就会越贴合你的想象。模型还能自动丰富提示词,即便简短描述也能获得细腻完整的画面。
你可以全面控制视频片段的长度和画幅。视频可长可短,最少9帧,最长可达481帧,帧率可自定义1至60帧/秒,24帧/秒为默认设置,呈现经典电影节奏。默认画面为121帧、横向16:9比例,天然适合宽屏及社交媒体,也可自由选择其它画幅,以适配不同项目。播放速度与长度联动,帧数多且帧率低时画面更慢、更柔和,帧率高时则运动更顺滑。
其中最具创造力的工具之一是相机运动的直接控制。不必将“镜头推向主体”这样模糊的表述交给模型猜测,你可直接选择实际的摄影机运动,如推镜向前、向后、左右移动,升降臂上升或下降,或锁定静止画面。这些专业、可调的机位动作让影视人能像现场拍摄一样准确反复操作,并可调节运动幅度以实现细腻或戏剧化的视觉效果,让叙事更具目的性,不再随机飘移。
音频和视频默认同步生成,也可单独关闭音频,只生成无声画面。同时,你可单独调节音画对提示的匹配紧密度,以及两者之间的权重分配——无论是想突出音景还是将焦点锁定于画面,都能灵活控制。
为实现整体连贯性和细节表现,模型采用多尺度生成:先快速草绘小尺寸草稿,再以该草稿为引导生成大尺寸高精细最终画面。这样保证了画面的一致性和洁净细节,远胜只用一次大尺寸渲染。你还可调节模型对提示的遵循程度,平衡创意自由度、精细化程度,实现速度与品质的最优组合。特定场景还可开启受控变体以提升质量。
通过负面提示,你可让模型回避不喜欢的画风。默认回避卡通、游戏风格、画面文字、水印、LOGO、字幕、慢动作和静止、平淡视频——以获得更具电影感的真实画面。你可以按美学需求修改这一设置。
输出方面,可导出多种常用格式:标准MP4、WebM、高端剪辑专用ProRes,或便捷分享用GIF动画。可选多档画质,支持更快导出、更小文件或均衡输出。加速设置也可按需取舍生成效率与画面保真度,适用快速迭代或最终成片。
出于可复现性,你可设定种子值,确保同样的提示和配置会产出一致的结果——便于你进行细微微调,无需每次从头开始。系统自带合规性安全检测,默认开启。
LTX-2.3 22B 最适合短格式电影级视频:氛围片段、概念镜头、社交短片、动画分镜或创意探索,内置音效省去了额外剪辑环节。模型以帧为单位生成自洽的瞬间场景,擅长突出单个意象,而非长篇多场景叙事。最大化利用它的关键在于:写出具象富有电影感的提示,选择有意图的机位运动,让多尺度渲染和自动精细化发挥威力。基于文本驱动的视频生成、原生音画同步,以及精准机位控制,能让创作者把想法快速转换成真实、有声有画的场景。
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
描述你的视频场景,包含动作、镜头角度和氛围
模型以自然的物理效果和光线打造电影级动态画面
下载并分享可直接使用的视频成品
展示持续的跟拍运动、车辆动态与引擎音效,全景宽屏电影段落,适用于YouTube及影视作品。
呈现大气雾气动态、光影变换和沉浸式自然音效,打造Netflix风格纪录片景观内容。
体现模型音画同步输出,带人群声音、动感舞台灯光与有力镜头运动,适合横屏影院画面。
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
立即切换至推理引导式生成

Fast cinematic video with audio
0.1 积分
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 积分

Text to video with audio
0.3 积分

Cinematic video from references
0.4 积分

Film-grade video with audio
0.1 积分

Cinematic video from references
10 积分

Fast balanced text-to-video generation
1.6 积分

Cinematic video with native audio
1.4 积分

Frontier 2K text-to-video generation
7.3 积分