Cinematic video with native audio
Seedance 2.0 文本转视频是字节跳动最先进的文本生成视频模型,可以将一段简短的文本提示转化为具有电影感、可直接分享的视频。与许多只能生成单一无声镜头的视频生成器不同,Seedance 2.0 能够输出完整场景,具备原生同步音频、多镜头剪辑、逼真的真实物理效果,以及导演级的摄影机控制——所有内容均可根据你的描述一键生成。
该模型的核心能力是像阅读一个微型分镜剧本一样理解你的提示。你不仅可以描述发生了什么,还能指定剧情如何在不同镜头中展开。例如,通过提示“章鱼在海里发现一个足球,高兴地叫来其他章鱼朋友一起玩,接着切换到海底章鱼踢足球的场面”,生成的视频会真实切换不同场景,将动作分布在多个镜头中,而不是困于单调的静帧。这项多镜头能力让你能够在一次生成中快速创作出完整的短片故事板。
其一大亮点是原生音频生成。模型默认会为画面搭配同步音轨,包括音效、环境音以及与角色口型精准对齐的对白。这意味着角色可以开口说话,口型与对白同步,环境也拥有逼真的氛围声效,各类动作亦能配以合适音效,无需单独配音。如果你更喜欢自制配乐,也可以关闭音频生成,获得无声视频。
Seedance 2.0 强调真实世界物理表现,因此运动画面极具真实感:水流自然,物体跌落或碰撞合理,动作有重量感,而非飘忽不定。结合导演级摄影机控制,你可以通过提示自由设定镜头感觉——流畅的运镜、大气的构图和动态动作,只需通过文本描述即可实现。
分辨率与格式选项
模型支持多种输出分辨率,灵活适配你的需求与工作流。你可以选择 480p 快速试想法,720p 作为平衡默认,1080p 适合高品质成片,4K 带来最高清晰度。这一范围让你能用低清晰度快速草拟创意,再用高分辨率渲染最终成片。
宽高比完全灵活。你可以选 16:9 横屏、9:16 竖屏/竖版内容适配手机或社交平台,1:1 方形动态,4:3 或 3:4 经典比例,及 21:9 超宽电影感。若不想自己选择,可使用自动选项,让模型根据你的提示智能匹配最佳构图。
时长也可调节。你可以设定 4 至 15 秒的任意时长,或让模型自动判断最合适的长度,便于适配故事场景节奏。
成片品质可控。标准模式保持文件默认大小,高质量选项则输出更精细、更大的文件,适合需要最高画质用于交付或后期编辑的场景。
适用人群
Seedance 2.0 非常适合希望原型设计场景、动态分镜或完整短片序列的影视创作者,无需相机和团队支持。社交媒体创作者和市场人可针对不同平台输出竖屏或方形内容,且自带原生音效。设计师和艺术家可激发现有概念动起来,体验风格化或创变效果。由于模型一次性完成剪辑、拍摄和配音,对于需要一键生成成品片段而非后续拼接素材的场景价值更高。
核心创意自由控制
最佳实践
由于模型对叙事结构敏感,将提示词写成分镜表(如标注“切换到”提示场景变化)有助于获得多镜头剪辑效果。初步尝试时可用较低分辨率和短时长快速探索灵感,确定喜欢的效果后再用 1080p 或 4K 高质量选项输出交付成片。需要人物对白时,直接在提示词中加入台词,模型能自动对口型。针对特定平台内容,建议直接设定所需宽高比而非依赖自动选择。
每一次生成都会返回本次使用的种子,便于多次迭代整理思路。凭借电影级画面、同步音效、真实运动和分镜讲述,Seedance 2.0 能让一段文字灵感直接落地为完整、氛围感十足的短视频片段。
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
描述你的视频场景,包含动作、镜头角度和氛围
模型以自然的物理效果和光线打造电影级动态画面
下载并分享可直接使用的视频成品
利用 Seedance 2.0 导演级摄影控制,展现复杂多段运镜、氛围场景动态,以及16:9 超宽电影叙事和同步环境音效。
展现 Seedance 2.0 的车辆动力学、气候特效切换和高能动态摄影,适用于商业级横屏短片制作。
展示 Seedance 2.0 渲染复杂自然现象、真实物理光效、水下水面无缝切换场景,并融合沉浸同步音效,呈现电影级纪录片内容。
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
立即切换至推理引导式生成

Film-grade video with audio
0.1 积分
Text to video with audio
0.7 积分

Fast cinematic video with audio
0.1 积分
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 积分

Cinematic video from references
0.4 积分

Fast balanced text-to-video generation
1.6 积分

Cinematic video from references
10 积分