Cinematic video from references
Seedance 2.0 Fast Reference to Video és el model de vídeo de referència més avançat de ByteDance, presentat en una versió ràpida optimitzada per aconseguir resultats més veloços sense perdre ni una mica de creativitat. En comptes de generar un vídeo només des d’un prompt de text, et permet alimentar el model amb el teu propi material de referència i després coreografiar com aquests elements apareixen junts a la pantalla. Pots combinar fins a nou imatges de referència, tres vídeos de referència i tres clips d’àudio en una sola generació, barrejant fonts visuals i sonores per guiar l’aspecte, el moviment i el so del clip final.
El que diferencia aquest model és com pots assenyalar directament les teves referències dins el prompt. Cada imatge, vídeo o arxiu d’àudio que pugis rep un identificador senzill, així que pots escriure coses com @Image1, @Video2 o @Audio1 directament a la descripció per indicar exactament a quin moment o subjecte ha d’influir cada font. Això vol dir que no confies només en què el model capti l’ambient; estàs assignant explícitament el personatge d’una imatge, l’estil de moviment d’un clip, o la veu o ambient d’un àudio, i descrivint com interaccionen. Aquest sistema és ideal per transformar i estilitzar material ja existent, mantenir personatges i estils entre diferents plans, i fer lip-sync amb l’àudio proporcionat.
El model genera el vídeo final amb àudio sincronitzat. Quan l’opció de generació d’àudio està activada, produeix efectes sonors, ambient i parla sincronitzada amb les accions de la imatge, fent que un personatge que parla mogui la boca al ritme de les paraules. Si prefereixes crear la banda sonora o la veu tu mateix, pots aportar clips d’àudio de referència i referenciar-los al teu prompt. Tingues en compte que, sempre que incloguis àudio de referència, també has d’incloure almenys una imatge o vídeo per tal que el model tingui una base visual on ancorar el so.
Tens un control flexible sobre l’enquadrament. Pots triar entre una àmplia selecció de proporcions: 16:9 per pantalla panoràmica, 9:16 per contingut vertical per a mòbil, 1:1 per a xarxes socials, 21:9 per a seqüències cinematogràfiques, i també 4:3 o 3:4, o deixar que el model triï automàticament segons el teu prompt. La durada també s’adapta fàcilment: pots generar clips d’entre 4 i 15 segons, o deixar-ho en mode automàtic perquè s’ajusti a la història que descriguis. Aquest rang et permet produir tant clips socials curts i en bucle com fragments narratius més llargs.
Pel que fa a la qualitat de sortida, pots triar entre 480p per generar ràpidament o 720p per un equilibri més òptim. També hi ha una opció de qualitat extra per demanar un arxiu més gran i de més qualitat quan vols un resultat el més net possible, o quedar-te amb la versió estàndard per a fitxers més lleugers. Aquestes opcions et deixen ajustar la velocitat i la mida del fitxer segons si estàs iterant idees ràpidament o vols exportar una peça final.
Els formats d’entrada acceptats són pràctics i variats. Les imatges poden ser JPEG, PNG o WebP. Els vídeos poden ser MP4 o MOV, cadascun ha d’estar entre 480p i 720p de resolució, i la suma de la durada de tots els clips ha d’estar entre 2 i 15 segons. L’àudio pot ser MP3 o WAV, amb una durada total màxima de 15 segons entre tots els clips. Pots incloure fins a dotze referències (imatges, vídeos i àudios) per generació, donant-te una paleta rica però manejable.
Aquest model encaixa a la perfecció amb molts perfils creatius. Cineastes i editors poden utilitzar-lo per estilitzar i transformar metratge, allargar una escena o combinar diverses preses en un mateix pla. Creadors de contingut i productors per a xarxes socials es beneficien dels enquadraments verticals i quadrats i de la durada curta, perfecta per a feeds. Dissenyadors de personatges i animadors poden aprofitar el sistema de referències per mantenir el subjecte reconeixible i fer lip-sync a partir d’una veu proporcionada. Músics i narradors hi poden combinar una pista amb visuals, i deixar que el model sincronitzi imatge i so. Com que pots referenciar fonts específiques pel seu nom al prompt, el model premia la direcció descriptiva i precisa: com més clarament especificis quin referent fa cada acció i com s’ha de desenvolupar l’escena, més control tindràs sobre el resultat.
Hi ha alguns detalls pràctics a tenir en compte. L’àudio de referència necessita sempre almenys una imatge o vídeo de referència. Els teus vídeos han d’ajustar-se a la resolució i la durada admeses, i el total de l’àudio no pot superar els quinze segons. El màxim de referències combinant imatges, vídeos i àudio són dotze fitxers, així que planifica quines fonts són claus pel teu pla. Més resolució i més qualitat genera fitxers més grans i atractius però tarda més a renderitzar, mentre que 480p i la versió estàndard són ideals per iteració ràpida. Els resultats milloren quan el material de referència és clar, ben il·luminat i ben enquadrat, i quan cada referència s’anomena i es descriu el moviment, l’ambient i el so que vols. Usat així, Seedance 2.0 Fast Reference to Video es torna una eina flexible per transformar les teves imatges, clips i àudios en vídeos curts sincronitzats al so amb l’estètica que tu guies.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descriu l'escena del teu vídeo amb moviment, angles de càmera i ambient
El model crea moviment cinematogràfic amb física i il·luminació naturals
Descarrega i comparteix el teu vídeo a punt per publicar
Demostra la simulació de física real i dinàmica ambiental del model—recreant sistemes meteorològics creïbles, moviment animal i transformacions dramàtiques amb qualitat cinematogràfica tipus Netflix i so natiu.
Mostra la precisió de Seedance 2.0 en física d’objectes, líquids, detall macro i transicions estilitzades—ideal per a cinematografia de productes de luxe amb àudio atmosfèric i efectes sincronitzats.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passa't avui a la síntesi guiada per raonament
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crèdits

Fast balanced text-to-video generation
1.6 crèdits
Text to video with audio
0.7 crèdits

Film-grade video with audio
0.1 crèdits

Cinematic video with native audio
1.4 crèdits

Cinematic video from references
10 crèdits

Text to video with audio
0.3 crèdits

Frontier 2K text-to-video generation
7.3 crèdits

Fast cinematic video with audio
0.1 crèdits