Cinematic video from references
Seedance 2 Reference to Video ist das fortschrittlichste referenzgesteuerte Videomodell von ByteDance, entwickelt für Kreative, die die Generierung mit echtem Quellenmaterial lenken möchten, anstatt nur mit Text. Statt alles von Grund auf zu beschreiben, füttern Sie das Modell mit einer Mischung aus Referenzdateien – bis zu 9 Bildern, 3 Videos und 3 Audioclips (insgesamt 12 Dateien aller Typen) – und verweben sie mit einem schriftlichen Prompt. Sie verweisen in Ihrem Prompt direkt auf jedes Asset mit einfachen Tags wie @Image1, @Video1 oder @Audio1, damit das Modell genau weiß, welches Gesicht, welche Umgebung, Bewegung oder welchen Klang es einhalten soll. Das Ergebnis ist ein einzelner kontinuierlicher kinematografischer Clip, der Ihre Referenzen respektiert und die Welt darum herum ausfüllt.
Das herausragende Feature ist natives Audio. In einem einzigen Generierungsdurchlauf erzeugt das Modell synchronisierten Klang neben dem Bild: Umgebungsgeräusche, Soundeffekte, Musik und sogar lippen-synchrone Dialoge. Es gibt keinen separaten Schritt, um Sound später hinzuzufügen. Das bedeutet, dass eine lebhafte Menschenmenge mit überlappenden Rufen, Kameraauslöser-Klicks, fernen Sirenen und einem im Leerlauf tickenden Motor bereits integriert und auf die Bildaktion abgestimmt ankommt. Sie können die Audiogenerierung aktiviert lassen, um einen vollständig fertigen Clip zu erhalten, oder sie deaktivieren, wenn Sie den Sound selbst handhaben möchten.
Kreative Kontrolle ist eine große Stärke. Sie lenken die Kamera über Ihren Prompt mit kinematografischer Sprache, fordern Dolly-Zooms, Tracking-Shots, Handheld-Bewegungen mit natürlichem Mikrozittern, POV-Wechsel und Augenhöhen- oder erhöhte Perspektiven. Das Modell interpretiert diese Anweisungen wie ein Kameramann. Es beherrscht auch realistische Physik, sodass Flüssigkeitsdynamik, Stoffbewegungen und Charakterbewegungen glaubwürdig wirken. Eine besonders nützliche Funktion ist Multi-Shot-Editing: Innerhalb eines einzelnen Generierungsdurchlaufs von bis zu 15 Sekunden kann das Modell natürliche Schnitte erzeugen und Sequenzen schaffen, die flüssig zwischen Shots wechseln, anstatt ein einziges festes Bild.
Da es Bildreferenzen akzeptiert, glänzt das Modell bei Konsistenz. Geben Sie eine Charakterreferenz vor, und es rendert dasselbe Gesicht und Outfit durch den gesamten Shot, sogar wenn es das Subjekt in einen anderen visuellen Stil überträgt. Beispiele zeigen einen Hybrid-Look, bei dem stilisiertes 3D-animiertes Charakter nahtlos in eine fotorealistische Live-Action-Umgebung integriert wird, wobei das referenzierte Charakter ein perfekt konsistentes Gesicht und das exakte Outfit aus dem Quellbild behält, während es glaubwürdig mit echtem Licht, Blitzreflexen, Straßenlaternen-Highlights und geworfenen Schatten interagiert. Das macht es zur starken Wahl für alle, die wiederkehrende Charaktere, ein spezifisches Produkt oder einen festen Look über eine Szene hinweg zuverlässig halten müssen.
Bei den Ausgabeoptionen können Sie bei 480p für schnellere Ergebnisse generieren, 720p für ein Gleichgewicht aus Geschwindigkeit und Qualität oder 1080p für hochwertige Resultate. Die Dauer ist flexibel von 4 bis 15 Sekunden, oder Sie lassen das Modell basierend auf Ihrem Prompt automatisch entscheiden. Das Seitenverhältnis ist ebenso anpassbar: Wählen Sie 16:9 für Landschaft, 9:16 für vertikale und Social-Formate, 1:1 für Quadrat, 21:9 für ultrabreites kinematografisches Framing, 4:3, 3:4 oder auto, damit das Modell wählt. Sie können auch eine höherwertige Kodierung anfordern, wenn Sie eine größere, sauberere Datei wünschen, und einen Seed-Wert fixieren, um ein Ergebnis zu reproduzieren, das Ihnen gefällt, obwohl leichte Variationen möglich sind.
Die Referenzeingaben haben sinnvolle Limits, die Sie kennen sollten. Bilder können JPEG, PNG oder WebP bis zu 30 MB pro Stück sein, bis zu 9 erlaubt. Videos können MP4 oder MOV sein, mit kombinierter Dauer zwischen 2 und 15 Sekunden, Gesamtgröße unter 50 MB und Auflösung pro Video zwischen 480p und 720p, bis zu 3 erlaubt. Audio kann MP3 oder WAV sein, bis zu 3 Clips mit kombinierter Dauer von maximal 15 Sekunden und 15 MB pro Clip. Wichtige Regel: Wenn Sie Audioreferenzen angeben, müssen Sie mindestens ein Referenzbild oder -video hinzufügen. Und unabhängig von der Mischung darf die Gesamtzahl der Referenzdateien aller Modalitäten 12 nicht überschreiten.
Wer profitiert? Filmemacher und Videoregisseure erhalten eine Möglichkeit, kurze kinematografische Sequenzen mit echter Kamerasprache und fertigen Sounds zu previsualisieren oder zu produzieren. Content-Creator und Social-Media-Produzenten können aus einer einzigen Charakterreferenz konsistente vertikale Clips erzeugen. Werbetreibende und Produktmarketer können ein Produktbild in eine gestylte, beleuchtete Umgebung mit kontrollierter Kamerabewegung platzieren. Animatoren und Mixed-Media-Künstler können stilisiertes Charaktere in fotorealistische Welten mischen – genau der Hybrid-Workflow, der in den Beispielen hervorgehoben wird. Da es auf Ihren eigenen Bildern, Videos und Audios basiert, ist es ideal, wenn Markenkonsistenz, Charakteridentität oder ein spezifischer Look wichtiger sind als reine Text-zu-Video-Raterei.
Einige Best Practices ergeben sich natürlich aus dem Funktionsprinzip. Schreiben Sie Prompts wie ein Regisseur: Beschreiben Sie den Stil, die Beleuchtung und Umgebung, das Subjekt, die Aktionssequenz und den gewünschten Audio, und referenzieren Sie Ihre Assets explizit mit @-Tags, damit das Modell weiß, was es erhalten soll. Halten Sie Ihre Videoreferenzen innerhalb der Dauer- und Auflösungslimits, damit sie sauber genutzt werden können, und erinnern Sie sich, dass Audio mindestens eine visuelle Referenz zur Verankerung erfordert. Für die poliertesten Ergebnisse setzen Sie auf detaillierte Aktionsbeschreibungen und Kamerarichtungen, da das Modell auf diese Spezifität gut reagiert, wie im aufwendigen Menschenmenge- und Konvoi-Beispiel zu sehen.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beschreibe deine Videoszene mit Bewegung, Kamerawinkeln und Stimmung
Das Modell erzeugt filmische Bewegung mit natürlicher Physik und Beleuchtung
Lade dein produktionsfertiges Video herunter und teile es
Hebt die Regisseur-Kamera-Kontrolle von Seedance 2 mit komplexen Multi-Stage-Bewegungen, atmosphärischer Wettersimulation und dramatischen Landschaftsdynamiken hervor – geeignet für Breitbild-Travel-Kinematografie.
Zeigt die Fähigkeit von Seedance 2, komplexe Szenenübergänge, stilisiertes Physik (zerspringendes Glas, schwebende Trümmer) und dramatische Lichtchoreografie zu handhaben – demonstriert Cut-Scene-Narrative für Music-Video-Produktion.
Präsentiert den realen Physik-Engine und native Audiogenerierung von Seedance 2 mit Umgebungs-Sounddesign (knirschender Schnee, Wind, Atmen) – demonstriert Netflix-Qualitäts-Naturdoku-Footage mit präziser Tierbewegung und atmosphärischen Dynamiken.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Wechsle noch heute zur reasoning-gesteuerten Synthese

Fast cinematic video with audio
0.1 Credits

Fast balanced text-to-video generation
1.6 Credits
Text to video with audio
0.7 Credits

Cinematic video from references
0.4 Credits

Text to video with audio
0.3 Credits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 Credits

Film-grade video with audio
0.1 Credits

Cinematic video with native audio
1.4 Credits

Frontier 2K text-to-video generation
7.3 Credits