Cinematic video from references
Seedance 2 Reference to Video är ByteDances mest avancerade referensdrivna videomodell, byggd för kreatörer som vill styra genereringen med verkligt källmaterial istället för enbart text. Istället för att beskriva allt från grunden matar du modellen med en blandning av referensfiler, upp till 9 bilder, 3 videor och 3 ljudklipp (med totalt 12 filer över alla typer), och väver ihop dem med en skriven prompt. Du pekar på varje tillgång direkt i din prompt med enkla taggar som @Image1, @Video1 eller @Audio1, så modellen vet exakt vilket ansikte, miljö, rörelse eller ljud du vill att den ska respektera. Resultatet är en enda kontinuerlig filmsekvens som respekterar dina referenser samtidigt som den fyller i världen runt dem.
Den framträdande funktionen är inbyggt ljud. På en enda genereringspass producerar modellen synkroniserat ljud tillsammans med bilden: omgivningsljud, ljudeffekter, musik och till och med läppsynkroniserad dialog. Det finns ingen separat steg för att lägga till ljud senare. Det innebär att en livlig folkmassa kan komma med överlappande rop, kameraklicks, avlägsna sirener och en tomgångsmotor redan inbakad och synkroniserad med handlingen på skärmen. Du kan lämna ljudgenereringen på för en helt färdig klipp, eller stänga av den om du föredrar att hantera ljudet själv.
Kreativ kontroll är en stor styrka. Du styr kameran genom din prompt med filmiskt språk, och begär dolly zoom, tracking shots, handheld-rörelser med naturlig mikroskakning, POV-byte och ögonhöjd eller förhöjda perspektiv. Modellen tolkar dessa instruktioner som en filmfotograf skulle göra. Den hanterar också realistisk fysik, så vätskedynamik, tyg rörelser och karaktärsrörelser beter sig trovärdigt. En särskilt användbar funktion är multi-shot-redigering: inom en enda generering på upp till 15 sekunder kan modellen skapa naturliga klipp, vilket ger sekvenser som flyter mellan shots istället för en enda låst bildruta.
Eftersom den accepterar bildreferenser utmärker sig modellen i konsistens. Ge en karaktärsreferens och den kan rendera samma ansikte och outfit genom hela sekvensen, även när subjektet översätts till en annan visuell stil. Exempel visar en hybridlook där stiliserade 3D-animerade karaktärer kompositas sömlöst in i en helt fotorealistisk live-action-miljö, med den refererade karaktären som behåller ett perfekt konsekvent ansikte och exakt outfit från källbilden, samtidigt som den interagerar trovärdigt med verkligt ljus, blixtreflexer, gatlyktor och kastade skuggor. Detta gör den till ett starkt val för alla som behöver en återkommande karaktär, en specifik produkt eller en fast look som förblir pålitlig genom en scen.
På utdataalternativ kan du generera i 480p för snabbare svarstid, 720p för en balans mellan hastighet och kvalitet, eller 1080p för högkvalitativa resultat. Längd är flexibel från 4 till 15 sekunder, eller så kan du låta modellen bestämma automatiskt baserat på din prompt. Bildförhållande är lika anpassningsbart: välj 16:9 för landskap, 9:16 för vertikala och sociala format, 1:1 för kvadratiskt, 21:9 för ultravid filmram, 4:3, 3:4 eller auto för att låta modellen välja. Du kan också begära en högre kvalitetskodning när du vill ha en större, renare fil, och fixera ett seed-värde för att reproducera ett resultat du gillar, även om mindre variation kan förekomma.
Referensingångarna har rimliga begränsningar som är bra att känna till. Bilder kan vara JPEG, PNG eller WebP upp till 30 MB vardera, med upp till 9 tillåtna. Videor kan vara MP4 eller MOV, med kombinerad längd mellan 2 och 15 sekunder, totalt under 50 MB, och varje video mellan 480p och 720p upplösning, med upp till 3 tillåtna. Ljud kan vara MP3 eller WAV, upp till 3 klipp med kombinerad längd på högst 15 sekunder och max 15 MB vardera. En viktig regel: om du tillhandahåller ljudreferenser måste du också inkludera minst en referensbild eller video. Oavsett hur du blandar dem får det totala antalet referensfiler över alla modaliteter inte överstiga 12.
Vem gynnas? Filmare och videoregissörer får ett sätt att previsualisera eller producera korta filmsekvenser med verkligt kameraspråk och färdigt ljud. Innehållsskapare och sociala medieproducenter kan förvandla en enda karaktärsreferens till konsekventa vertikala klipp. Annonsörer och produktmarknadsförare kan placera en produktbild i en stylad, upplyst miljö med kontrollerad kamerarörelse. Animatörer och mixed-media-konstnärer kan blanda stiliserade karaktärer i fotorealistiska världar, exakt den hybridarbetsflöde som visas i exemplen. Eftersom den bygger på dina egna bilder, videor och ljud är den idealisk närvarje brandkonsistens, karaktärsidentitet eller en specifik look är viktigare än ren text-till-video-gissning.
Några bästa praxis följer naturligt av hur den fungerar. Skriv prompts som en regissör: beskriv stilen, belysningen och miljön, subjektet, händelseförloppet och ljudet du vill ha, och referera dina tillgångar explicit med @-taggar så modellen vet vad den ska bevara. Håll dina videoreferenser inom längd- och upplösningsbegränsningarna för att de ska kunna användas rent, och kom ihåg att ljudreferenser kräver minst en visuell referens för att ankras. För de mest polerade resultaten, satsa på detaljerade beskrivningar av handling och kamerariktningar, eftersom modellen svarar bra på den nivån av specificitet, som ses i de utförliga exemplen med folkmassa och konvoj. Med genomtänkta referenser och tydlig riktning levererar Seedance 2 Reference to Video färdiga, ljudkompletta filmklipp som förblir trogna det material du tar med.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beskriv din videoscen med rörelse, kameravinklar och stämning
Modellen skapar filmisk rörelse med naturlig fysik och ljussättning
Ladda ner och dela din produktionsfärdiga video
Belyser Seedance 2:s regissörsnivå kamerakontroll med komplexa flerstegs kamerarörelser, atmosfärisk vädersimulering och dramatiska landskapsskalor – lämpligt för bredbilds resefilmografi.
Demonstrerar Seedance 2:s förmåga att hantera komplexa scenövergångar, stiliserad fysik (splittrande glas, flytande skräp) och dramatisk ljus koreografi – visar cut-scene-berättande för musikvideoproduktion.
Visar Seedance 2:s verklighetsfysikmotor och inbyggda ljudgenerering med miljöljuddesign (knarrande snö, vind, andning) – demonstrerar Netflix-kvalitet naturdokumentär med precis djurrörelse och atmosfäriska dynamiker.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Byt till resonemangsstyrd syntes idag

Frontier 2K text-to-video generation
7.3 krediter

Text to video with audio
0.3 krediter
Text to video with audio
0.7 krediter

Film-grade video with audio
0.1 krediter
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 krediter

Fast cinematic video with audio
0.1 krediter

Cinematic video from references
0.4 krediter

Cinematic video with native audio
1.4 krediter

Fast balanced text-to-video generation
1.6 krediter