Cinematic video from references
Seedance 2 Reference to Video est le modèle vidéo basé sur les références le plus avancé de ByteDance, conçu pour les créateurs qui souhaitent orienter la génération à partir de véritables sources plutôt que du texte seul. Au lieu de tout décrire de zéro, vous alimentez le modèle avec un mélange de fichiers de référence : jusqu'à 9 images, 3 vidéos et 3 extraits audio (pour un total de 12 fichiers tous types confondus), et vous les combinez grâce à une consigne écrite. Vous désignez chaque élément dans votre prompt via des balises simples comme @Image1, @Video1 ou @Audio1, pour que le modèle sache précisément quel visage, environnement, mouvement ou son respecter. Le résultat est un clip cinématographique continu unique, fidèle à vos références tout en complétant l'univers autour.
La fonctionnalité phare est l'audio natif. En une seule passe de génération, le modèle produit un son synchronisé avec l'image : bruitage d'ambiance, effets sonores, musique, et même dialogues synchronisés sur les lèvres. Il n'est pas nécessaire d'ajouter le son séparément : une scène de foule animée peut arriver déjà accompagnée de cris superposés, clics d'appareil photo, sirènes lointaines et moteur au ralenti, calés sur l'action à l'écran. L'option d'audio peut être laissée activée pour obtenir un clip finalisé, ou désactivée si vous souhaitez gérer le son vous-même.
Le contrôle créatif est un atout majeur. Vous guidez la caméra via votre prompt en utilisant un langage cinématographique : demandes de travelings, zooms avant/arrière, mouvements à l’épaule avec micro-vibrations naturelles, changements de point de vue, ou encore choix de perspectives à hauteur d’œil ou surélevées. Le modèle interprète ces instructions comme le ferait un chef opérateur. Il gère aussi une physique réaliste : fluides, mouvements de tissus et déplacements des personnages se comportent de façon crédible. Une capacité particulièrement utile : le montage multi-plans : en une génération pouvant aller jusqu'à 15 secondes, le modèle peut créer des coupes naturelles, produisant des séquences fluides au lieu d’un plan figé.
Grâce à l'import de références visuelles, le modèle excelle en cohérence. Fournissez une référence de personnage et il reproduira le même visage et la même tenue sur toute la séquence, même en changeant de style visuel. Les exemples montrent un rendu hybride dans lequel des personnages animés 3D stylisés sont intégré de façon transparente à un environnement live-action photoréaliste, le personnage référencé conservant un visage parfaitement constant et la tenue exacte de l’image d'origine, tout en interagissant naturellement avec la lumière réelle, les éclats de flash, les reflets de lampadaires et les ombres portées. Cela en fait un excellent choix pour toute personne ayant besoin d'un personnage récurrent, d’un produit spécifique ou d’une identité visuelle constante dans une scène.
Côté export, vous pouvez choisir 480p pour une rapidité maximale, 720p pour un équilibre vitesse/qualité, ou 1080p pour un résultat haute qualité. La durée est flexible, de 4 à 15 secondes, ou vous pouvez laisser le modèle choisir automatiquement selon votre prompt. Le format est également adaptable : optez pour 16:9 pour du paysage, 9:16 pour des formats verticaux et sociaux, 1:1 pour du carré, 21:9 pour un rendu cinémascope ultra-large, 4:3, 3:4, ou auto pour laisser le modèle choisir. Vous pouvez demander une exportation de qualité supérieure pour un fichier plus grand et plus propre, ainsi que fixer une seed pour reproduire un résultat apprécié, bien que de légères variations puissent subsister.
Les entrées de référence ont des limites à connaître. Les images peuvent être en JPEG, PNG ou WebP jusqu'à 30 Mo chacune, pour un maximum de 9. Les vidéos en MP4 ou MOV doivent durer entre 2 et 15 secondes au total, peser moins de 50 Mo, être en résolution 480p ou 720p, pour un maximum de 3 vidéos. Les audios au format MP3 ou WAV, jusqu'à 3 extraits, d'une durée totale maximale de 15 secondes et 15 Mo chacun. Règle importante : si vous fournissez des références audio, vous devez aussi inclure au moins une image ou vidéo de référence. Quelle que soit la combinaison, le nombre total de fichiers références ne peut dépasser 12.
Qui en profite ? Les réalisateurs et chef-opérateurs peuvent prévisualiser ou produire de courtes séquences cinématiques intégrant un vrai langage caméra et un son finalisé. Les créateurs de contenu et producteurs sociaux peuvent transformer une seule référence de personnage en clips verticaux cohérents. Les publicitaires et marketeurs peuvent intégrer un produit à une scène stylisée et éclairée, avec déplacement caméra contrôlé. Les animateurs et artistes “médias mixtes” peuvent fusionner des personnages stylisés dans des mondes photoréalistes — c'est le workflow hybride mis en avant dans les exemples. Puisque le modèle utilise vos propres images, vidéos et sons, il est parfait lorsqu'une continuité de marque, une identité de personnage ou une apparence précise comptent plus que la génération hasardée à partir de texte pur.
Quelques bonnes pratiques découlent logiquement de son fonctionnement. Rédigez vos prompts comme un réalisateur : décrivez le style, l’éclairage, l'environnement, le sujet, la séquence d’action et le son souhaité, et référencez vos médias explicitement avec des balises @ pour guider fidèlement le modèle. Respectez les limites de durée et résolution pour les références vidéo afin d'assurer une intégration fluide, et rappelez-vous qu’utiliser l’audio requiert au moins une référence visuelle pour l’ancrer. Pour un rendu optimal, détaillez au maximum les actions et consignes caméra, car le modèle réagit très bien à ce niveau de précision, comme démontré par l’exemple détaillé de foule et de convoi. Avec des références réfléchies et une direction claire, Seedance 2 Reference to Video produit des clips cinématographiques finalisés, son inclus, fidèles à votre matériau de base.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Décrivez votre scène vidéo avec le mouvement, les angles de caméra et l'ambiance
Le modèle crée un mouvement cinématographique avec une physique et un éclairage naturels
Téléchargez et partagez votre vidéo prête à la diffusion
Met en avant le contrôle caméra de Seedance 2 avec des déplacements complexes, simulation d’effets météo et dynamiques de paysages spectaculaires — pour une cinématographie de voyage en ultra-large.
Démontre la gestion des transitions complexes, de la physique stylisée (verre brisé, débris flottants) et de la chorégraphie lumineuse dramatique — montrant le potentiel narratif des clips pour la production musicale.
Met en avant le moteur physique réaliste de Seedance 2 et la génération audio native avec design sonore environnemental (craquement de neige, vent, souffle) — pour des images nature dignes de Netflix, avec mouvement animalier précis et ambiance maîtrisée.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Frontier 2K text-to-video generation
7.3 crédits

Film-grade video with audio
0.1 crédits

Fast cinematic video with audio
0.1 crédits

Text to video with audio
0.3 crédits

Fast balanced text-to-video generation
1.6 crédits

Cinematic video with native audio
1.4 crédits

Cinematic video from references
0.4 crédits
Text to video with audio
0.7 crédits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crédits