Cinematic video from references
Seedance 2 Reference to Video er ByteDance sitt mest avanserte referansemateriale-drevne videomodell, bygget for skapere som vil styre genereringen med ekte kildemateriale i stedet for bare tekst. I stedet for å måtte beskrive alt fra bunnen av, gir du modellen en miks av referansefiler – opptil 9 bilder, 3 videoer og 3 lydklipp (maks 12 filer totalt på tvers av alle typer) – og fletter dem sammen med en skrevet prompt. Du peker på hver ressurs direkte i prompten din med enkle tagger som @Image1, @Video1 eller @Audio1, slik at modellen vet nøyaktig hvilket ansikt, miljø, bevegelse eller lyd du vil den skal etterligne. Resultatet er et kontinuerlig, filmatisk klipp som respekterer referansene dine samtidig som den fyller ut resten av verden rundt dem.
Den mest unike egenskapen er innebygd lyd. I én og samme generering produserer modellen synkronisert lyd sammen med bildet: bakgrunnsstøy, lydeffekter, musikk og til og med leppesynkronisert dialog. Det er ikke nødvendig å legge på lyd etterpå. Det betyr at for eksempel en livlig folkemengdescene kan komme ferdig med rop, kamerasnapper, fjerne sirener og en tomgangsmotor, alt ferdig mikset og timet til handlingen på skjermen. Du kan la lydgenerering stå på for et helt ferdig klipp, eller slå det av hvis du heller vil håndtere lyden selv.
Kreativ kontroll er en stor fordel. Du styrer kameraet med prompten din ved å skrive inn filmatiske beskrivelser, og ber om dolly-zooms, tracking shots, håndholdte bevegelser med naturlig mikrorystelse, POV-bytter, og øyehøyde- eller fugleperspektiv. Modellen tolker disse instruksene slik en filmfotograf ville gjort. Den håndterer også realistisk fysikk, så væskedynamikk, klesbevegelser og karakteranimasjon oppfører seg troverdig. En spesielt nyttig funksjon er multishot-redigering: Innenfor én generering på opptil 15 sekunder kan modellen lage naturlige klipp, slik at sekvensene flyter mellom ulike opptak i stedet for å være låst til ett utsnitt.
Fordi den aksepterer bildereferanser, er modellen svært god på konsistens. Gir du en karakterreferanse, kan den beholde det samme ansiktet og antrekket gjennom hele opptaket, selv når motivet oversettes til en annen stil. Eksempler viser en hybrid stil, hvor stiliserte 3D-animerte karakterer settes sømløst inn i fotorealistiske live action-miljøer, med karakteren fra referansebildet helt konsekvent – samme ansikt, nøyaktig antrekk, alt mens de samhandler troverdig med ekte lys, refleksjoner, gatebelysning og skygger. Dette gjør modellen ideell for alle som trenger en gjennomgående karakter, spesifikt produkt eller en fast look gjennom en scene.
Når det gjelder utdata, kan du generere i 480p for raskere levering, 720p for balanse mellom kvalitet og hastighet, eller 1080p for høy kvalitet. Lengde er fleksibel fra 4 til 15 sekunder, eller lar du modellen bestemme automatisk ut fra prompten. Formatet er like fleksibelt: velg 16:9 for bredformat, 9:16 for vertikale og sosiale formater, 1:1 for firkant, 21:9 for ultrabredt filmformat, 4:3, 3:4, eller auto så modellen finner det beste selv. Du kan også be om høyere kvalitet på filen om du ønsker større og renere utdata, og låse en seed-verdi for å reprodusere et resultat du liker (merk at små variasjoner fortsatt kan oppstå).
Referansefilene har fornuftige grenser: Bilder kan være JPEG, PNG eller WebP opptil 30 MB per fil, maks 9 tillatt. Videoer kan være MP4 eller MOV, samlet varighet mellom 2 og 15 sekunder, total filstørrelse under 50 MB, hver video må være mellom 480p og 720p, og maks 3 videoer tillatt. Lyd kan være MP3 eller WAV, opptil 3 klipp, samlet varighet maks 15 sekunder og maks 15 MB per klipp. Viktig regel: Om du legger til lydreferanser, må du også legge til minst ett bilde eller én video. Uansett miks er maksimalt antall referansefiler totalt 12.
Hvem passer modellen for? Filmskapere og regissører får en måte å forhåndsvise eller produsere korte filmatiske sekvenser med ekte kameraspråk og ferdigmikset lyd. Innholdsskapere og sosiale medieprodusenter kan gjøre én karakterreferanse om til konsistente vertikale klipp. Annonsører og markedsførere kan plassere et produktbilde i et stylisert, lyssatt miljø med kontrollert kamerabevegelse. Animatører og mixed media-kunstnere kan blande stiliserte figurer inn i fotorealistiske verdener, akkurat som demonstrert i eksemplene. Fordi du bruker egne bilder, videoer og lyd, er dette idealet for alle tilfeller der merkevarekonsistens, karakteridentitet eller en spesifikk look betyr mer enn ren tekst-til-video-gjetting.
Noen gode praksiser faller naturlig ut fra hvordan det fungerer. Skriv prompten din som en regissør: Beskriv stilen, lyset og miljøet, motivet, handlingen og lyden du ønsker, og referer til ressursene eksplisitt med @-tagger, slik at modellen vet hva som skal bevares. Hold videoreferansene innenfor grenseverdier på varighet og oppløsning for at de skal brukes mest mulig effektivt, og husk at lyd krever minst én visuell referanse å forankre seg i. For mest mulig polert resultat, bruk detaljerte handlingsbeskrivelser og kamerainstruksjoner – modellen responderer godt på slike spesifikke innspill, slik man ser i eksempelet med folkemengden og konvoien. Med nøye utvalgte referanser og tydelig regi gir Seedance 2 Reference to Video deg ferdige, lydkomplette filmklipp som er tro mot materialet du har valgt.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beskriv videoscenen din med bevegelse, kameravinkler og stemning
Modellen skaper filmatisk bevegelse med naturlig fysikk og lyssetting
Last ned og del den produksjonsklare videoen din
Fremhever Seedance 2 sin regissørnøyaktige kamerakontroll med komplekse flertrinns kamerabevegelser, stemningsskapende vær og dramatiske sceneendringer — perfekt for widescreen reisevideo.
Viser Seedance 2 sin evne til å håndtere komplekse sceneskift, stilisert fysikk (knust glass, svevende partikler), og dramatisk lyskoreografi — fremhever historiefortelling via klipp for musikkvideoproduksjon.
Viser Seedance 2 sin realistiske fysikkmotor og innebygde lydgenerering med miljølyddesign (knasende snø, vind, pust) — demonstrerer Netflix-kvalitet naturdokumentar med presise dyrebevegelser og stemningsfulle miljøskifter.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Bytt til resonneringsstyrt syntese i dag

Text to video with audio
0.3 kreditter
Text to video with audio
0.7 kreditter

Fast balanced text-to-video generation
1.6 kreditter

Cinematic video from references
0.4 kreditter

Fast cinematic video with audio
0.1 kreditter

Film-grade video with audio
0.1 kreditter

Cinematic video with native audio
1.4 kreditter
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 kreditter

Frontier 2K text-to-video generation
7.3 kreditter