Cinematic video from references
Seedance 2 Reference to Video to najbardziej zaawansowany model wideo oparty na referencjach firmy ByteDance, stworzony dla twórców, którzy chcą kierować generacją za pomocą rzeczywistych materiałów źródłowych zamiast samego tekstu. Zamiast opisywać wszystko od zera, dostarczasz modelowi mieszankę plików referencyjnych: do 9 obrazów, 3 wideo i 3 klipów audio (łącznie do 12 plików wszystkich typów), a następnie łączysz je z pisemnym promptem. Wskazujesz każdy zasób bezpośrednio w prompcie za pomocą prostych tagów, takich jak @Image1, @Video1 lub @Audio1, dzięki czemu model dokładnie wie, której twarzy, otoczenia, ruchu lub dźwięku ma przestrzegać. Rezultatem jest pojedynczy ciągły klip kinowy, który szanuje twoje referencje, jednocześnie wypełniając świat wokół nich.
Wyjątkową cechą jest natywne audio. W jednym przejściu generacji model produkuje zsynchronizowany dźwięk obok obrazu: szumy otoczenia, efekty dźwiękowe, muzykę i nawet dialogi zsynchronizowane z ruchem ust. Nie ma osobnego kroku dodawania dźwięku później. Oznacza to, że scena z tętniącym tłumem może przyjść z nakładającymi się okrzykami, kliknięciami migawki aparatu, odległymi syrenami i pracującym na jałowym biegu silnikiem, już wbudowanymi i zsynchronizowanymi z akcją na ekranie. Możesz zostawić generację audio włączoną, aby uzyskać w pełni gotowy klip, lub wyłączyć ją, jeśli wolisz sam zająć się dźwiękiem.
Kontrola kreatywna to jedna z głównych zalet. Kierujesz kamerą za pomocą promptu, używając języka kinowego: dolly zoom, tracking shots, ruch handheld z naturalnym mikrodrżeniem, zmiany POV i perspektywy na poziomie oczu lub z góry. Model interpretuje te wskazówki jak operator kamery. Obsługuje też realistyczną fizykę, więc dynamika płynów, ruch tkanin i animacja postaci zachowują się wiarygodnie. Szczególnie przydatna jest edycja wielo-ujęciowa: w jednej generacji do 15 sekund model może stworzyć naturalne cięcia, dając sekwencje płynnie przechodzące między ujęciami zamiast pojedynczej zablokowanej klatki.
Ponieważ akceptuje referencje obrazowe, model wyróżnia się spójnością. Podaj referencję postaci, a renderuje tę samą twarz i strój w całym ujęciu, nawet przy przekształcaniu przedmiotu w inny styl wizualny. Przykłady pokazują hybrydowy wygląd, gdzie stylizowane postacie 3D są płynnie kompozycjonowane w w pełni fotorealistyczne otoczenie live-action, z referencyjną postacią zachowującą idealnie spójną twarz i dokładny strój ze zdjęcia źródłowego, jednocześnie realistycznie wchodząc w interakcję ze światłem, odbiciami flesza, oświetleniem ulicznym i rzucanymi cieniami. To czyni go doskonałym wyborem dla każdego, kto potrzebuje powtarzającej się postaci, konkretnego produktu lub stałego wyglądu w całej scenie.
W opcjach wyjściowych możesz generować w 480p dla szybszego czasu, 720p dla równowagi prędkości i jakości lub 1080p dla wysokiej jakości. Czas trwania jest elastyczny: od 4 do 15 sekund lub model może zdecydować automatycznie na podstawie promptu. Proporcje obrazu są równie elastyczne: wybierz 16:9 dla krajobrazu, 9:16 dla pionu i formatów social, 1:1 dla kwadratu, 21:9 dla ultrawide kinowego kadru, 4:3, 3:4 lub auto, by model wybrał. Możesz też zażądać wyższej jakości kodowania dla większego, czystszego pliku i ustalić seed, by odtworzyć lubiany wynik, choć drobne wariacje mogą wystąpić.
Wejścia referencyjne mają rozsądne limity. Obrazy mogą być JPEG, PNG lub WebP do 30 MB każdy, do 9 dozwolonych. Wideo w MP4 lub MOV, z łącznym czasem 2-15 sekund, całkowitym rozmiarem poniżej 50 MB, rozdzielczością 480p-720p każdy, do 3 dozwolonych. Audio w MP3 lub WAV, do 3 klipów z łącznym czasem do 15 sekund i maks. 15 MB każdy. Ważna zasada: jeśli podajesz referencje audio, musisz dołączyć co najmniej jeden obraz lub wideo. Bez względu na mieszankę, całkowita liczba plików referencyjnych nie może przekroczyć 12.
Kto zyskuje? Reżyserzy filmowi i wideo zyskują sposób na prewizualizację lub produkcję krótkich sekwencji kinowych z prawdziwym językiem kamery i gotowym dźwiękiem. Twórcy treści i producenci social mogą przekształcić pojedynczą referencję postaci w spójne pionowe klipy. Reklamodawcy i marketerzy produktów mogą wrzucić obraz produktu do stylizowanego, oświetlonego otoczenia z kontrolowanym ruchem kamery. Animatorzy i artyści mixed-media mogą mieszać stylizowane postacie z fotorealistycznymi światami, dokładnie w hybrydowym workflow z przykładów. Ponieważ opiera się na twoich obrazach, wideo i audio, jest idealny, gdy spójność marki, tożsamość postaci lub konkretny wygląd są ważniejsze niż czysta generacja tekst-do-wideo.
Kilka najlepszych praktyk wynika naturalnie z działania modelu. Pisz prompty jak reżyser: opisuj styl, oświetlenie i otoczenie, podmiot, sekwencję akcji oraz pożądany dźwięk, a referencje wskazuj explicite tagami @, by model wiedział, co zachować. Trzymaj referencje wideo w limitach czasu i rozdzielczości, pamiętaj, że audio wymaga co najmniej jednej wizualnej kotwicy. Dla najbardziej wypolerowanych wyników, skup się na szczegółowych opisach akcji i kierunkach kamery — model dobrze reaguje na taką precyzję, jak w przykładach z tłumem i konwojem. Z przemyślanymi referencjami i jasnymi wskazówkami Seedance 2 Reference to Video dostarcza gotowe, kompletne dźwiękowo klipy kinowe wierne twoim materiałom.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Opisz scenę wideo, uwzględniając ruch, ujęcia kamery i nastrój
Model tworzy filmowy ruch z naturalną fizyką i oświetleniem
Pobierz i udostępnij gotowe do produkcji wideo
Podkreśla kontrolę kamery na poziomie reżysera z złożonymi ruchami wieloetapowymi, symulacją pogody i dynamiką scen krajobrazowych — do szerokiego formatu podróżniczego.
Demonstruje obsługę złożonych przejść scen, stylizowanej fizyki (pękające szkło, unoszące się szczątki) i choreografii oświetlenia — ukazując zdolności narracyjne cut-scene do produkcji teledysków.
Pokazuje silnik fizyki realnego świata Seedance 2 i natywne audio z designem dźwięków otoczenia (chrzęst śniegu, wiatr, oddech) — dając jakość Netflix przyrodniczego dokumentu z precyzyjną animacją zwierząt i dynamiką atmosferyczną.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Przejdź już dziś na syntezę kierowaną rozumowaniem

Film-grade video with audio
0.1 kredytów

Cinematic video from references
0.4 kredytów

Text to video with audio
0.3 kredytów

Fast balanced text-to-video generation
1.6 kredytów

Cinematic video with native audio
1.4 kredytów

Frontier 2K text-to-video generation
7.3 kredytów
Text to video with audio
0.7 kredytów

Fast cinematic video with audio
0.1 kredytów
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 kredytów