Cinematic video from references
Seedance 2.0 Fast Reference to Video est le modèle vidéo basé sur les références le plus avancé de ByteDance, proposé dans une version optimisée pour des résultats plus rapides sans sacrifier la créativité. Plutôt que de générer une vidéo à partir d'une simple description textuelle, vous pouvez fournir au modèle vos propres références et orchestrer la façon dont ces éléments s’assemblent à l’écran. Il est possible de combiner jusqu’à neuf images de référence, trois vidéos de référence et trois extraits audio en une seule génération, en mélangeant sources visuelles et sonores pour influencer l'apparence, le mouvement et le son du clip final.
Ce qui différencie ce modèle, c’est la façon directe dont vous pouvez désigner vos références dans votre prompt. Chaque image, vidéo et fichier audio que vous téléchargez reçoit un identifiant simple : il suffit d’écrire @Image1, @Video2 ou @Audio1 dans votre description pour indiquer au modèle quelle source doit influencer quel moment ou quel sujet. Vous ne vous contentez pas d’espérer que le modèle comprenne une ambiance — vous nommez le personnage d'une image, le style de mouvement d’un clip, la voix ou l'ambiance d’un extrait audio, puis vous décrivez leurs interactions. C’est un flux de travail idéal pour transformer et styliser du contenu existant, transporter des personnages et des looks d’un plan à l’autre, ou synchroniser la bouche à l'audio fourni.
Le modèle génère une vidéo finalisée avec un son synchronisé. Lorsque la génération audio est activée, il produit des effets sonores, des ambiances et des dialogues synchronisés avec les actions à l’écran : ainsi, un sujet parlant bouge la bouche en rythme avec les paroles. Si vous préférez utiliser votre propre bande-son ou voix, vous pouvez fournir des extraits audio de référence et y faire appel dans votre prompt. Remarque : si vous incluez de l’audio de référence, vous devez également fournir au moins une image ou une vidéo de référence afin que le modèle ait un élément visuel pour ancrer le son.
Vous contrôlez l’encadrement de manière flexible. Choisissez parmi tous les formats d’image courants, incluant le 16:9 panoramique pour l’horizontal, le 9:16 vertical pour le mobile, le carré 1:1 pour les réseaux sociaux, l’ultra-large 21:9 pour des séquences cinématiques, ou encore les options 4:3 et 3:4, ou laissez le modèle choisir automatiquement selon votre prompt. La durée est tout aussi adaptable : générez des clips de 4 à 15 secondes, ou optez pour une durée automatique en fonction de votre description. Cette flexibilité permet de produire aussi bien des boucles sociales rapides qu’un rythme narratif plus long.
Côté qualité, choisissez entre 480p pour une génération plus rapide ou 720p pour une meilleure balance. Une option qualité supérieure permet de demander une version avec fichier plus volumineux pour un rendu optimal, ou de rester sur la version standard pour des fichiers légers. Ces réglages vous permettent d’arbitrer entre rapidité, taille de fichier et fidélité, que vous soyez en recherche d’idées ou sur le rendu final.
Les formats d’entrées pris en charge sont variés et pratiques. Les images de référence peuvent être en JPEG, PNG ou WebP, les vidéos de référence en MP4 ou MOV (entre 480p et 720p, pour une durée totale allant de 2 à 15 secondes parmi tous vos clips), l’audio de référence en MP3 ou WAV (jusqu’à 15 secondes au total). Vous pouvez fournir jusqu’à douze éléments de référence au total, tous types de fichiers confondus, vous offrant ainsi une grande palette tout en gardant la génération fluide et simple à gérer.
Ce modèle répond aux besoins d’un large éventail de professionnels créatifs. Réalisateurs et monteurs vidéo peuvent styliser et transformer des rushes, allonger une scène ou fusionner plusieurs prises. Créateurs de contenu et producteurs pour réseaux sociaux tirent avantage du cadrage vertical ou carré et des durées courtes taillées pour les feeds. Designers de personnages et animateurs s’appuient sur le système de référence pour garder un sujet reconnaissable et piloter la synchronisation labiale à partir d’une voix fournie. Musiciens et conteurs audio peuvent assortir un morceau à de la vidéo et laisser le modèle synchroniser le mouvement sur le son. Puisque vous pouvez citer chaque source par son nom dans le prompt, plus vos instructions sont précises et descriptives, plus vous maîtrisez le rendu final.
Quelques points pratiques à retenir : l’audio de référence requiert toujours au moins une image ou une vidéo de référence. Vos vidéos de référence doivent rester dans les limites acceptées de résolution et de durée, et votre audio total ne peut dépasser quinze secondes. Le nombre total de références possibles est de douze fichiers : sélectionnez les plus importants pour votre scène. Résolution et qualité élevées produisent des fichiers plus volumineux et beaux mais augmentent le temps de génération, tandis que le 480p et la version standard conviennent pour itérer rapidement. Comme pour tout modèle basé sur des références, les résultats sont meilleurs avec un matériel source net, bien éclairé, bien cadré, et en précisant chaque référence dans le prompt, avec la description du mouvement, de l’ambiance et du son recherchés. Utilisé ainsi, Seedance 2.0 Fast Reference to Video devient un outil flexible pour transformer vos images, clips et audios en vidéos courtes synchronisées, avec le rendu que vous dirigez.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Décrivez votre scène vidéo avec le mouvement, les angles de caméra et l'ambiance
Le modèle crée un mouvement cinématographique avec une physique et un éclairage naturels
Téléchargez et partagez votre vidéo prête à la diffusion
Démontre la simulation réaliste de la physique et de l’atmosphère — rendant météo crédible, mouvements animaliers et transformations dramatiques avec un langage cinématographique digne de Netflix et un son natif.
Met en avant la précision de Seedance 2.0 avec la physique des objets, les dynamiques fluides, le souci du détail macro et des transitions stylisées — idéal pour la mise en scène de produits de luxe avec des bruitages synchronisés et une ambiance sonore immersive.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Film-grade video with audio
0.1 crédits

Cinematic video with native audio
1.4 crédits

Fast balanced text-to-video generation
1.6 crédits

Frontier 2K text-to-video generation
7.3 crédits

Cinematic video from references
10 crédits

Fast cinematic video with audio
0.1 crédits

Text to video with audio
0.3 crédits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crédits
Text to video with audio
0.7 crédits