Cinematic video from references
Seedance 2.0 Fast Reference to Video è il modello video a riferimento più avanzato di ByteDance, presentato in una versione ottimizzata per risultati rapidi senza compromettere la gamma creativa. Invece di generare un video solo da un prompt di testo, ti permette di fornire al modello i tuoi materiali di riferimento e poi coreografare come questi elementi si combinano sullo schermo. Puoi unire fino a nove immagini di riferimento, fino a tre video di riferimento e fino a tre clip audio in un'unica generazione, mescolando e abbinando fonti visive e sonore per guidare l'aspetto, il movimento e il suono del video finale.
Ciò che rende unico questo modello è la possibilità di richiamare direttamente un riferimento specifico all'interno del prompt. Ogni immagine, video e file audio che carichi riceve un identificativo semplice, così puoi scrivere @Image1, @Video2 o @Audio1 direttamente nella descrizione per indicare esattamente quale fonte deve influenzare quale momento o soggetto. Non devi sperare che il modello colga l'atmosfera: puoi nominare il personaggio di un'immagine, lo stile di movimento di una clip e la voce o l'ambiente da una traccia audio, quindi descrivere come questi elementi interagiscono. È un flusso di lavoro pensato per trasformare e stilizzare contenuti esistenti, trasportare personaggi e look tra le inquadrature e sincronizzare le labbra sulle voci fornite.
Il modello restituisce video finiti con audio sincronizzato. Quando l’opzione di generazione audio è attiva, produce effetti sonori, rumori ambientali e discorsi sincronizzati con i movimenti labiali che corrispondono all’azione sullo schermo, così un soggetto parlante muove la bocca a tempo con le parole. Se preferisci usare una colonna sonora o una voce propria, puoi fornire le tue clip audio di riferimento e citarle nel prompt. Nota che ogni volta che includi un audio di riferimento, è necessario fornire anche almeno un’immagine o un video di riferimento affinché il modello abbia un ancoraggio visivo a cui collegare il suono.
Hai controllo flessibile sull’inquadratura. Puoi scegliere tra diversi rapporti di aspetto, tra cui widescreen 16:9 per visualizzazione orizzontale, 9:16 verticale e mobile-first, 1:1 quadrato per i feed social, ultrawide 21:9 per sequenze cinematografiche, oltre alle opzioni 4:3 e 3:4, oppure lasciare che sia il modello a decidere automaticamente in base al tuo prompt. Anche la durata è adattabile: genera clip da 4 a 15 secondi, oppure imposta su automatico per lasciare che il modello adatti la lunghezza alla storia descritta. Questa flessibilità ti consente di realizzare qualsiasi cosa, da una breve clip social in loop rapido a una sequenza narrativa più lunga.
Per la qualità dell’output, puoi scegliere tra 480p per una generazione più veloce o 720p per un risultato più bilanciato. Esiste anche un controllo di qualità che ti permette di richiedere una versione a qualità superiore e file più grandi quando desideri il massimo della nitidezza, oppure di rimanere sulla versione standard per file più piccoli. Queste impostazioni ti permettono di bilanciare velocità e dimensione del file rispetto alla fedeltà, a seconda che tu voglia iterare rapidamente o esportare una versione finale.
Gli input supportati sono ampi e pratici. Le immagini di riferimento possono essere JPEG, PNG o WebP. I video di riferimento possono essere MP4 o MOV — ciascuno deve essere tra 480p e 720p circa di risoluzione e la durata complessiva delle clip tra 2 e 15 secondi. L’audio di riferimento può essere MP3 o WAV, con durata totale massima di 15 secondi tra tutte le tracce. In totale, puoi inserire fino a dodici elementi di riferimento in una singola generazione, ottenendo una tavolozza ricca ma mantenendo gestibile il lavoro per il modello.
Questo modello è ideale per una vasta gamma di professionisti creativi. Registi e montatori video possono usarlo per stilizzare e trasformare riprese, estendere una scena o fondere più take in un’unica inquadratura coesa. I content creator e i produttori social possono sfruttare le opzioni verticali e quadrate e le durate brevi perfette per i feed. I character designer e gli animatori possono usare il sistema di riferimento per mantenere riconoscibile un soggetto nella clip e gestire il lip-sync da una voce fornita. Musicisti e storyteller possono abbinare una traccia alle immagini lasciando che il modello sincronizzi il movimento al suono. Poiché puoi nominare ogni fonte specifica nel prompt, il modello premia una direzione chiara e dettagliata: più specifichi quali riferimenti fanno cosa e come dovrebbe evolversi la scena, più controllo avrai sul risultato finale.
Alcune considerazioni pratiche: l’audio di riferimento richiede sempre almeno un’immagine o un video di riferimento. I tuoi video di riferimento devono rispettare le finestre di risoluzione e durata supportate, e l’audio totale non deve superare i quindici secondi. Il numero complessivo massimo tra immagini, video e audio è dodici file, quindi scegli le fonti più rilevanti per la tua scena. Risoluzioni e qualità maggiori producono file più grandi e belli ma impiegano più tempo per il rendering, mentre i 480p e la versione standard sono ideali per iterazioni rapide. Come in ogni generazione basata su riferimenti, i risultati migliorano se il materiale origine è pulito, ben illuminato e inquadrato chiaramente, e se nel prompt nomini ogni riferimento esplicitamente e descrivi il movimento, l’atmosfera e il suono desiderato. Usato così, Seedance 2.0 Fast Reference to Video diventa uno strumento flessibile per trasformare immagini, clip e audio in brevi video sincronizzati con il suono secondo la tua visione.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descrivi la tua scena video con movimento, angolazioni di ripresa e atmosfera
Il modello crea movimenti cinematografici con fisica e illuminazione naturali
Scarica e condividi il tuo video pronto per la produzione
Dimostra la simulazione fisica realistica e la dinamicità atmosferica del modello — riproducendo sistemi meteo verosimili, movimenti animali realistici e trasformazioni ambientali drammatiche con linguaggio cinematografico di qualità Netflix e audio nativo.
Dimostra la precisione di Seedance 2.0 con la fisica degli oggetti, dinamica dei liquidi, dettagli macro e transizioni stilizzate senza soluzione di continuità — ideale per spot di prodotti di lusso con foley sincronizzati e audio atmosferico.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passa oggi alla sintesi guidata dal ragionamento
Text to video with audio
0.7 crediti

Film-grade video with audio
0.1 crediti

Cinematic video from references
10 crediti
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crediti

Fast cinematic video with audio
0.1 crediti

Text to video with audio
0.3 crediti

Cinematic video with native audio
1.4 crediti

Frontier 2K text-to-video generation
7.3 crediti

Fast balanced text-to-video generation
1.6 crediti