Cinematic video from references
Seedance 2 Reference to Video è il modello video basato su riferimenti più avanzato di ByteDance, creato per i creator che vogliono guidare la generazione usando materiale sorgente reale invece che solo testo. Invece di descrivere tutto da zero, puoi fornire al modello una combinazione di file di riferimento: fino a 9 immagini, 3 video e 3 clip audio (per un totale massimo di 12 file di qualsiasi tipo), e unirli tramite un prompt scritto. Indichi ogni asset direttamente nel prompt usando tag semplici come @Image1, @Video1 o @Audio1, così il modello sa esattamente quale volto, ambiente, movimento o suono deve rispettare. Il risultato è una clip cinematografica continua che rispetta i tuoi riferimenti riempiendo il mondo intorno ad essi.
La caratteristica principale è l'audio nativo. In una sola passata, il modello produce suono sincronizzato insieme alle immagini: rumori ambientali, effetti sonori, musica e perfino dialoghi sincronizzati con il labiale. Non è necessario aggiungere il suono in un secondo momento. Così una scena di folla può arrivare già con grida sovrapposte, clic di fotocamera, sirene lontane e un motore al minimo perfettamente adattati all'azione sullo schermo. Puoi lasciare attiva la generazione audio per ottenere una clip completa e finita, oppure disattivarla se preferisci gestire tu l'audio.
Il controllo creativo è uno dei punti di forza. Puoi dirigere la telecamera tramite il prompt usando un linguaggio cinematografico, chiedendo dolly zoom, carrellate, movimenti a mano libera con micro-movimenti naturali, cambi di punto di vista e prospettive dall’alto o dal basso. Il modello interpreta queste indicazioni come farebbe un direttore della fotografia. Gestisce anche la fisica realistica, quindi dinamiche dei fluidi, movimento dei tessuti e movimenti dei personaggi risultano credibili. Una funzione particolarmente utile è il montaggio multi-shot: in una sola generazione fino a 15 secondi, il modello può creare tagli naturali, offrendo sequenze fluide tra diverse inquadrature invece di un unico fotogramma statico.
Grazie all’accettazione di riferimenti visivi, il modello eccelle nella coerenza. Fornisci il riferimento di un personaggio e sarà perfettamente riconoscibile nello stesso volto e abito per tutta la sequenza, anche se trasformato in uno stile visivo differente. Negli esempi, si vede un look ibrido in cui personaggi animati 3D stilizzati vengono inseriti senza soluzione di continuità in ambientazioni live-action fotorealistiche, mantenendo il volto e l’abbigliamento esattamente come nell’immagine sorgente, interagendo in modo credibile con luce reale, riflessi del flash, luci dei lampioni e ombre. È la scelta ideale per chi ha bisogno di un personaggio ricorrente, di un prodotto specifico o di un look coerente costante in scena.
Per l’output, puoi generare a 480p per una consegna più rapida, 720p per un compromesso tra velocità e qualità, oppure 1080p per risultati di alta qualità. La durata è flessibile da 4 a 15 secondi o può essere decisa automaticamente dal modello in base al tuo prompt. Anche il formato è personalizzabile: scegli tra 16:9 per orizzontale, 9:16 per verticale e social, 1:1 quadrato, 21:9 per cinema ultrawide, 4:3, 3:4 oppure lascia che decida il modello. Puoi richiedere anche una codifica di maggiore qualità per file più grandi e puliti, e fissare un valore seed per riprodurre un risultato che ti piace (possono comunque esserci lievi variazioni).
Gli input di riferimento hanno limiti sensati da conoscere. Le immagini possono essere JPEG, PNG o WebP fino a 30 MB ciascuna, per un massimo di 9. I video possono essere MP4 o MOV, durata totale tra 2 e 15 secondi, massimo 50 MB totali, e risoluzione tra 480p e 720p per singolo video (max 3 video). L’audio può essere MP3 o WAV, fino a 3 tracce per una durata complessiva massima di 15 secondi e massimo 15 MB ciascuna. Regola importante: se fornisci riferimenti audio, devi anche includere almeno un’immagine o un video di riferimento. E in ogni caso, il totale dei file di riferimento di ogni tipo non può superare 12.
A chi è utile? Registi e filmmaker possono pre-visualizzare o produrre sequenze cinematografiche corte usando un vero linguaggio da camera e audio già pronto. I content creator e i social media producer possono trasformare un singolo riferimento di personaggio in clip verticali coerenti. Advertiser e marketer possono inserire la foto di un prodotto in un ambiente illuminato e stilizzato con movimento di camera controllato. Animatori e artisti mixed-media possono fondere personaggi stilizzati in mondi fotorealistici, come negli esempi di workflow ibrido. Poiché usa i tuoi asset, immagini, video e audio, è ideale ogni volta che la coerenza di brand, l’identità di un personaggio o uno stile preciso contano più dell’approccio solo testo-to-video.
Alcune buone pratiche derivano dal funzionamento stesso. Scrivi prompt come un regista: descrivi stile, luce e ambiente, soggetto, movimento e l’audio desiderato, e richiama gli asset con i tag @ in modo esplicito, così il modello sa cosa conservare. Tieni i video nei limiti di durata e risoluzione per garantirne la pulizia, e ricorda che serve almeno un riferimento visivo se vuoi usare l’audio. Per risultati più curati, punta su descrizioni dettagliate delle azioni e della camera, dato che il modello risponde molto bene a quel livello di specificità, come nell’esempio della folla e del convoglio. Con riferimenti pensati e una regia chiara, Seedance 2 Reference to Video crea clip cinematografiche finite e complete di suono, perfettamente fedeli al materiale che porti nel modello.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descrivi la tua scena video con movimento, angolazioni di ripresa e atmosfera
Il modello crea movimenti cinematografici con fisica e illuminazione naturali
Scarica e condividi il tuo video pronto per la produzione
Metti in risalto il controllo camera da regista di Seedance 2 con movimenti di camera complessi e a più stadi, simulazioni atmosferiche e dinamiche di scena paesaggistiche ad alto impatto per il travel cinema in ultrawide.
Dimostra la capacità di Seedance 2 di gestire transizioni di scena complesse, fisica stilizzata (vetri che si frantumano, detriti sospesi) e coreografie luminose per narrazioni tipo cut-scene in produzioni video musicali.
Mostra il motore fisico realistico di Seedance 2 e la generazione audio nativa con sound design ambientale (neve che scricchiola, vento, respiro) — dimostrando video documentari naturalistici in stile Netflix con movimenti animali precisi e atmosfere fedele.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passa oggi alla sintesi guidata dal ragionamento

Fast balanced text-to-video generation
1.6 crediti

Film-grade video with audio
0.1 crediti
Text to video with audio
0.7 crediti

Frontier 2K text-to-video generation
7.3 crediti

Cinematic video from references
0.4 crediti

Cinematic video with native audio
1.4 crediti

Text to video with audio
0.3 crediti
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crediti

Fast cinematic video with audio
0.1 crediti