Cinematic video from references
Seedance 2.0 Fast Reference to Video is het meest geavanceerde referentiegestuurde videomodel van ByteDance, geleverd in een snelle laag voor snellere resultaten zonder in te leveren op creatieve mogelijkheden. In plaats van alleen een video te genereren op basis van een tekstprompt, laat het je eigen referentiemateriaal aanleveren en vervolgens regisseren hoe deze elementen op het scherm samenkomen. Je kunt tot negen referentieafbeeldingen, drie referentievideo's en drie audioclips combineren in één generatie, waarbij je visuele en audiobronnen mixt en matcht om het uiterlijk, de beweging en het geluid van de uiteindelijke video te bepalen.
Wat dit model uniek maakt, is hoe direct je in je prompt naar je referenties kunt verwijzen. Elke afbeelding, video en audiobestand dat je uploadt krijgt een eenvoudige naam, zodat je dingen als @Image1, @Video2 of @Audio1 direct in je omschrijving kunt opnemen om aan te geven welke bron welk moment of onderwerp beïnvloedt. Je hoeft dus niet te hopen dat het model de juiste sfeer oppikt: je benoemt expliciet het karakter uit één afbeelding, de beweging uit een clip en de stem of sfeer uit een audiotrack, en beschrijft vervolgens hoe ze samenkomen. Het is een workflow voor het transformeren en stijlen van bestaand materiaal, om karakters en stijlen over shots heen constant te houden, en om lip-sync per vormgegeven audio mogelijk te maken.
Het model levert afgewerkte video's met gesynchroniseerd geluid. Als audiogeneratie aanstaat, worden geluidseffecten, omgevingsgeluiden en lipsynchroon gesproken tekst geproduceerd die precies bij de actie op het scherm passen, bijvoorbeeld als een pratend personage de mond mee beweegt met de woorden. Wil je liever je eigen soundtrack of stem gebruiken, dan kun je referentie-audioclips uploaden en deze in je prompt benoemen. Let op: bij het gebruik van referentie-audio is altijd minimaal één referentieafbeelding of -video nodig, zodat het model iets visueels heeft om het geluid aan te koppelen.
Je hebt flexibele controle over de kadrering. Kies uit een volledig scala aan beeldverhoudingen, waaronder breedbeeld 16:9 voor liggend beeld, 9:16 voor verticaal en mobiel-gericht gebruik, 1:1 vierkant voor sociale feeds, ultrabreed 21:9 voor filmische scènes, plus 4:3 en 3:4, of laat het model automatisch de verhoudingen bepalen op basis van je prompt. De duur is eveneens flexibel: maak clips van 4 tot 15 seconden, of stel deze automatisch in zodat de lengte aansluit bij het beschreven verhaal. Hiermee maak je eenvoudig alles van een korte looping social clip tot een langere verhalende sequentie.
Voor de outputkwaliteit kun je kiezen tussen 480p voor snelle generatie en 720p voor een gebalanceerd resultaat. Daarnaast kun je kiezen voor een hogere kwaliteit en grotere bestandsgrootte wanneer je het schoonste beeld wilt, of juist voor de standaard versie voor kleinere bestanden. Zo kun je snelheid en bestandsgrootte makkelijk afwegen tegen beeldkwaliteit, afhankelijk van of je snel ideeën wilt testen of juist een definitief resultaat produceert.
De ondersteunde inputbestanden zijn praktisch en breed. Referentieafbeeldingen kunnen JPEG, PNG of WebP zijn. Referentievideo’s mogen MP4 of MOV zijn, en bij voorkeur tussen 480p en 720p resolutie, met een totale clipduur tussen 2 en 15 seconden. Referentie-audio kan MP3 of WAV zijn, met een totale audiolengte van maximaal 15 seconden. In totaal mag je tot twaalf referentie-items van elk type samen in één generatie gebruiken – zo heb je een rijke bron aan materiaal terwijl het proces overzichtelijk blijft voor het model.
Dit model is geschikt voor een breed scala aan creatieve professionals. Filmmakers en videomakers kunnen het inzetten om materiaal te stijlen en transformeren, een scène uit te breiden of om meerdere takes samen te voegen tot één vloeiend shot. Content creators en social media makers halen voordeel uit de verticale en vierkante framing en de korte, krachtige clips voor social feeds. Character designers en animators kunnen via het referentiesysteem zorgen dat een personage herkenbaar blijft door een clip heen en lipsync aansturen met een aangeleverde stem. Muzikanten en audiovertellers kunnen een track koppelen aan beeld en laten het model de bewegingen syncen met het geluid. Omdat je expliciet naar bronnen verwijst in je prompt, beloont het model duidelijke, beschrijvende regie: hoe duidelijker je opschrijft welke referentie wat doet en hoe het shot zich ontwikkelt, des te meer controle heb je over het eindresultaat.
Een paar praktische aandachtspunten: referentie-audio vereist altijd minimaal één referentieafbeelding of -video. Je referentievideo’s moeten binnen de aangegeven resolutie- en lengtelimieten vallen, en het totaal aan audiobestanden mag niet langer zijn dan vijftien seconden. In totaal kun je maximaal twaalf referenties tegelijk gebruiken, dus kies bewust wat het belangrijkst is voor je shot. Hogere resolutie en kwaliteit leveren mooiere, maar grotere bestanden die langer duren om te genereren, terwijl 480p en de standaardversie juist ideaal zijn voor snelle iteratie. Zoals bij alle referentie-gebaseerde generaties: hoe schoner, beter belicht en duidelijker gekaderd je bronmateriaal én hoe explicieter je referenties en beschrijvingen, hoe beter je resultaat. Zo wordt Seedance 2.0 Fast Reference to Video een flexibele tool waarmee je jouw eigen beeld, clips en geluid omzet naar korte, geluidssynchrone video's met precies de uitstraling die jij bedenkt.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beschrijf je videoscène met beweging, camerahoeken en sfeer
Het model creëert cinematische beweging met natuurlijke fysica en belichting
Download en deel je productieklare video
Toont de simulatie van echte fysica en sfeer door het model — met realistische weersystemen, dierbewegingen en dramatische omgevingsveranderingen in Netflix-waardige filmstijl en native audio.
Toont Seedance 2.0's precisie met objectfysica, vloeistofdynamica, macro-details en naadloze gestileerde overgangen — ideaal voor luxe productcinematografie met gesynchroniseerde foley en omgevingsgeluid.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Schakel vandaag over op reasoning-gestuurde synthese

Cinematic video from references
10 credits

Fast cinematic video with audio
0.1 credits

Fast balanced text-to-video generation
1.6 credits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 credits

Text to video with audio
0.3 credits
Text to video with audio
0.7 credits

Frontier 2K text-to-video generation
7.3 credits

Cinematic video with native audio
1.4 credits

Film-grade video with audio
0.1 credits