Cinematic video from references
Seedance 2 Reference to Video és el model de vídeo amb referència més avançat de ByteDance, creat per a creadors que volen dirigir la generació amb material real en lloc de només text. En comptes de descriure-ho tot des de zero, pots alimentar el model amb una combinació d’arxius de referència: fins a 9 imatges, 3 vídeos i 3 clips d’àudio (fins a 12 fitxers en total entre tots els tipus), i combinar-los amb un prompt escrit. Pots assenyalar cada actiu directament en el teu prompt fent servir etiquetes simples com @Image1, @Video1 o @Audio1, perquè el model sàpiga exactament quina cara, entorn, moviment o so vols preservar. El resultat és un clip cinematogràfic continu que respecta fidelment les teves referències mentre omple el món al seu voltant.
La característica estrella és l’àudio natiu. En una sola passada, el model produeix so sincronitzat juntament amb la imatge: soroll ambiental, efectes sonors, música i fins i tot diàlegs sincronitzats amb el moviment dels llavis. No cal afegir el so en un pas posterior. Això vol dir que una escena multitudinària pot arribar ja amb crits superposats, clics de càmera, sirenes llunyanes i un motor en marxa, tot ben integrat i sincronitzat amb l’acció a la pantalla. Pots deixar la generació d’àudio activada per obtenir un clip acabat, o desactivar-la si prefereixes treballar l’àudio per separat.
El control creatiu és un dels grans punts forts. Pots dirigir la càmera amb llenguatge cinematogràfic al prompt, demanant dolly zooms, seguiments, moviments a mà amb micro-vibració natural, canvis de POV i perspectives a l’alçada dels ulls o elevades. El model interpreta aquestes indicacions com ho faria un director de fotografia. També reprodueix una física realista: dinàmica de fluids, moviment de teles i dinàmica de personatges de manera creïble. Una funcionalitat clau és l’edició multi-plànol: en una sola generació de fins a 15 segons, pot crear talls naturals i seqüències que flueixen entre diferents plans, en lloc d’un pla únic bloquejat.
Acceptant referències d’imatge, el model excel·leix en la consistència. Dona una referència de personatge i pot mantenir la mateixa cara i vestuari en tot el pla, fins i tot quan transforma el subjecte a un estil visual diferent. Els exemples mostren un look híbrid en què personatges animats 3D s’integren sense fissures en un entorn d’acció real totalment fotorrealista, mantenint la mateixa cara i la roba exacta de la imatge original, tot interactuant de forma creïble amb la llum real, reflexos, il·luminació de fanals i ombres projectades. És ideal per a qui necessita un personatge recurrent, un producte concret o una imatge fixa que es mantingui constant al llarg de l’escena.
Pel que fa a sortides, pots generar a 480p per més rapidesa, 720p per equilibri entre velocitat i qualitat, o 1080p per resultats d’alta qualitat. La durada és flexible: de 4 a 15 segons, o pots deixar que el model ho decideixi segons el teu prompt. El format d’aprofitament també és adaptable: escull 16:9 per apaisat, 9:16 per formats verticals i socials, 1:1 per quadrat, 21:9 per panoràmic cinematogràfic, 4:3, 3:4 o auto perquè el model triï. També pots demanar una codificació de més qualitat si vols un fitxer més gran i net, i fixar una seed per reproduir un resultat que t’agradi, tot i que pot haver-hi petites variacions.
Els límits dels inputs de referència són lògics. Les imatges poden ser JPEG, PNG o WebP fins a 30 MB cadascuna, amb un màxim de 9. Els vídeos poden ser MP4 o MOV, amb una durada total de 2 a 15 segons, un pes total menor de 50 MB, i cada vídeo entre 480p i 720p, amb un màxim de 3. L’àudio pot ser MP3 o WAV, amb un màxim de 3 talls que junt no superin els 15 segons i 15 MB cadascun. Una regla clau: si inclous referències d’àudio, cal incorporar també almenys una imatge o vídeo de referència. I independentment de com els combinis, el total d’arxius de referència (imatges, vídeos, àudios) no pot superar 12.
Qui se’n beneficia? Directors i realitzadors poden previsualitzar o crear seqüències curtes amb llenguatge de càmera real i àudio acabat. Creadors de contingut i productors de xarxes socials poden convertir una sola referència de personatge en clips verticals consistents. Marques i anunciants poden incrustar una imatge de producte en un entorn estilitzat i il·luminat amb moviment controlat de càmera. Animadors i artistes multimèdia poden barrejar personatges estilitzats en mons fotorrealistes, exactament el flux híbrid que es veu als exemples. Com que utilitza les teves imatges, vídeos i àudios, és perfecte si la consistència de marca, la identitat d’un personatge o l’aparença concreta són més importants que una predicció purament de text a vídeo.
Algunes bones pràctiques sorgeixen del seu funcionament. Escriu prompts com un director: descriu l’estil, la llum i l’ambient, el subjecte, la seqüència d’acció i l’àudio que vols, i fes servir explicitament @etiquetes perquè el model sàpiga quins elements ha de preservar. Mantén les referències de vídeo dins dels límits de durada i resolució per una integració neta, i recorda que si afegeixes audio has d’incloure almenys una referència visual. Per resultats més polits, sigues detallat amb les accions i les direccions de càmera, ja que el model respon molt bé a aquest nivell d’especificitat, com es comprova en l’exemple elaborat d’escena de multitud i comboi. Amb bones referències i una direcció clara, Seedance 2 Reference to Video ofereix clips cinematogràfics acabats, amb so, i fidels al material que li proporciones.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descriu l'escena del teu vídeo amb moviment, angles de càmera i ambient
El model crea moviment cinematogràfic amb física i il·luminació naturals
Descarrega i comparteix el teu vídeo a punt per publicar
Destaca el control de càmera nivell director de Seedance 2 amb moviments de càmera complexos en diverses etapes, simulació de clima atmosfèric i dinàmica de grans escenes per al cinema panoràmic de viatges.
Demostra la capacitat de Seedance 2 per gestionar transicions complexes d’escenes, física estilitzada (vidre esmicolat, restes flotants) i il·luminació dramàtica coreografiada — mostrant la narrativa entre escenes per a produccions de videoclips.
Mostra el motor de física real i la generació d’àudio natiu de Seedance 2 amb disseny de so ambiental (neu cruixent, vent, respiració) — demostrant metratge de documental de natura amb qualitat tipus Netflix i precisió en el moviment animal i la dinàmica ambiental.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passa't avui a la síntesi guiada per raonament

Film-grade video with audio
0.1 crèdits
Text to video with audio
0.7 crèdits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crèdits

Fast balanced text-to-video generation
1.6 crèdits

Cinematic video from references
0.4 crèdits

Text to video with audio
0.3 crèdits

Fast cinematic video with audio
0.1 crèdits

Cinematic video with native audio
1.4 crèdits

Frontier 2K text-to-video generation
7.3 crèdits