Cinematic video from references
Seedance 2 Reference to Video — это самая продвинутая референсно-управляемая видеомодель ByteDance, созданная для креаторов, которым важнее управлять генерацией с помощью реальных исходных материалов, а не только текста. Вместо описания всего с нуля вы подаете в модель микс из референсов: до 9 изображений, 3 видео и 3 аудиофайлов (всего до 12 файлов всех типов), объединяя их с помощью текстового промпта. Каждый asset указывается прямо в промпте через простые теги вроде @Image1, @Video1 или @Audio1, чтобы модель точно понимала, какое лицо, окружение, движение или звук ей нужно сохранить. В результате вы получаете единый непрерывный кинематографичный клип, уважающий ваши референсы и органично дополняющий мир вокруг них.
Главная особенность — нативный звук. За один проход модель создает синхронизированное аудио вместе с видеорядом: атмосферные шумы, спецэффекты, музыку и даже синхронизированную по губам речь. Нет необходимости отдельно добавлять звук после генерации. Так сцена многолюдной толпы может сразу появиться с перекрывающимися выкриками, щелчками затвора камеры, далекими сиренами и работящим двигателем, уже встроенными и выверенными по таймингу относительно действия в кадре. Можно оставить генерацию аудио включённой для полного клипа, либо выключить и озвучить ролик самостоятельно.
Творческий контроль — одно из главных преимуществ. Вы управляете работой камеры через промпт, используя кинематографичный язык: просите сделать dolly zoom, панорамирование, ручное движение камеры с естественной микровибрацией, смену POV, съёмку с уровня глаз или сверху. Модель интерпретирует такие команды как настоящий оператор-постановщик. Поддерживается реалистичная физика: жидкостная динамика, движение тканей, движение персонажей — всё выглядит правдоподобно. Особенно полезна функция монтажа из нескольких кадров: за один проход до 15 секунд модель способна нарезать ролик на естественные склеики в потоке, чтобы получился монтаж, а не статичный кадр.
Благодаря поддержке референсов-изображений модель выдаёт отличную консистентность. Дайте изображение персонажа — и он сохранит то же лицо и одежду в каждом кадре, даже если вы переводите его в другой визуальный стиль. Например, стилизованные 3D-персонажи могут быть органично внедрены в полностью фотореалистичную live-action среду — и при этом лицо, одежда и детали персонажа полностью совпадают с исходным образом, взаимодействуя с реальным светом, бликами от вспышек, уличными огнями, тенями. Это идеально для задач с повторяющимися героями, продуктами или обязательным единым стилем на протяжении всей сцены.
По вариантам вывода: можно генерировать в 480p для быстрой обработки, 720p для баланса или 1080p для максимального качества. Длительность гибко регулируется от 4 до 15 секунд, либо можно доверить выбор модели. Соотношение сторон также настраивается: 16:9 (горизонтальное), 9:16 (вертикальное и соцсети), 1:1 (квадрат), 21:9 (ультраширокий киноформат), 4:3, 3:4 или auto (на выбор модели). Для получения большего и более чистого файла доступны настройки улучшенного качества, а также фиксация seed для повторения понравившегося результата (небольшие вариации всё равно возможны).
На входные референсы действуют параметры: изображения — JPEG, PNG или WebP до 30 МБ каждое (до 9 штук). Видео — MP4 или MOV, общая длительность от 2 до 15 секунд, общий размер до 50 МБ, каждый клип — от 480p до 720p, всего до 3 штук. Аудио — MP3 или WAV, всего до 3 клипов, общая длительность не более 15 секунд каждый и до 15 МБ. Важно: если вы подаете аудиореференсы, обязательно добавьте хотя бы одно референсное изображение или видео. Суммарное количество файлов всех модальностей — не более 12.
Кому это выгодно? Режиссёры и операторы получают быстрый способ превизуализировать или сделать короткие кинематографичные сцены с настоящей операторской работой и финальным саунд-дизайном. Создатели соцмедиа могут из одного референса героя выпускать серию стабильных вертикальных роликов. Рекламодатели и маркетологи как раз могут интегрировать продуктовый образ в стилизованное, освещенное пространство с контролируемым движением камеры. Аниматоры и художники смешанных медиа — внедрять стилизованных персонажей в фотореалистичные миры, как показано в примерах. Модель отлично подходит для брендов, которым нужна идентичность героя, продукта или картинки, когда последовательность важнее, чем случайное видео по описанию.
Вот несколько практических советов: пишите промпты как режиссёр — описывайте стиль, свет и окружение, объект, динамику действия и желаемый звук, а также указывайте ассеты через @. Держите длительность и разрешение референсных видео в разрешённых рамках, помня, что для звуковых референсов должен быть хотя бы один визуальный. Лучшие результаты достигаются при подробном описании действий и операторских задач — модель отлично реагирует на такой уровень детализации, как в примере со сложной сценой толпы и кавалькадой. При чётких референсах и понятных указаниях Seedance 2 Reference to Video выдаёт финальные, кинематографичные и полностью озвученные клипы, максимально точно следуя введённой информации.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Опишите сцену вашего видео: движение, ракурсы камеры и настроение
Модель создаёт кинематографичное движение с естественной физикой и освещением
Скачайте видео, готовое к публикации, и поделитесь им
Seedance 2 реализует сложное операторское управление с многоступенчатыми движениями камеры, имитацией погоды и эпическими динамическими пейзажами — для travel-клипографии в широком формате.
Модель справляется со сложными сменами сцен, стилизованной физикой (разлетающееся стекло, парящие объекты) и драматичным светом — раскрывая возможности нарративного клипа для музыкального видео.
Seedance 2 объединяет реалистичную физику и нативную генерацию звука с атмосферным саунд-дизайном (скрип снега, ветер, дыхание), показывая результат уровня Netflix: движение животных и динамику природы в высочайшем качестве.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Перейдите на синтез с поддержкой рассуждений уже сегодня
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 кредитов

Film-grade video with audio
0.1 кредитов

Fast cinematic video with audio
0.1 кредитов

Frontier 2K text-to-video generation
7.3 кредитов

Cinematic video with native audio
1.4 кредитов
Text to video with audio
0.7 кредитов

Fast balanced text-to-video generation
1.6 кредитов

Cinematic video from references
0.4 кредитов

Text to video with audio
0.3 кредитов