Cinematic text-to-video with audio
Kling Video v3 Standard verwandelt schriftliche Beschreibungen in kinematische Videos, vollständig mit flüssiger, überzeugender Bewegung und Sound, der direkt neben dem Bild generiert wird. Speziell für Kreative entwickelt, die mehr als ein einzelnes bewegtes Bild wollen, erzeugt es polierte Clips, die wie von einem Regisseur inszeniert wirken – mit Kamerabewegungen, Beleuchtung und Tempo, die echtem Filmmaterial ähneln.
Im Kern handelt es sich um ein Text-zu-Video-Modell: Sie beschreiben die Szene, die Sie wollen, und es rendert sie. Ein Prompt wie „kinematischer Drohnenaufnahme, die durch moosbedeckte Steinruinen in der goldenen Stunde fliegt, aufsteigend durch zerfallende Bögen, um ein nebliges Tal mit volumetrischen Lichtstrahlen zu enthüllen“, ist genau die Art von geschichteter, kamerabewusster Anweisung, für die das Modell entwickelt wurde. Es beherrscht Atmosphäre, Maßstab und fotorealistische Details, was es ideal für Filmemacher macht, die Establishing-Shots aufbauen, Concept Artists, die Welten visualisieren, und Content-Creator, die beeindruckende B-Roll-Materialien on demand brauchen.
Eine der herausragenden Funktionen ist die native Audio-Generierung. Statt Sound in einem separaten Schritt hinzuzufügen, kann das Modell Audio als Teil derselben Generierung erzeugen, sodass der fertige Clip mit passendem Sound integriert ankommt. Sprachausgabe wird in Chinesisch und Englisch unterstützt, andere Sprachen werden automatisch ins Englische übersetzt. Für die saubersten gesprochene Ergebnisse empfehlen wir, englische Sprache in Kleinbuchstaben zu schreiben und Großbuchstaben für Akronyme oder Eigennamen zu reservieren, damit sie korrekt ausgesprochen werden. Wenn Sie einen stummen Clip bevorzugen – z. B. wenn Sie selbst Score oder Sound editieren möchten – kann die Audio-Generierung einfach deaktiviert werden.
Multi-Shot-Unterstützung ist der Bereich, in dem sich Kling v3 Standard wirklich von Single-Clip-Generatoren abhebt. Statt einer kontinuierlichen Einstellung können Sie ein Video aus mehreren unterschiedlichen Shots aufbauen, jeweils mit eigener Beschreibung und Länge. So können Sie eine kurze Sequenz skizzieren – einen Eröffnungs-Weitwinkel, ein näheres Detail, eine Enthüllung – und das Modell näht sie zu einem kohärenten Video zusammen. Sie können die Shots selbst layouten für volle Kontrolle oder die Struktur einem intelligenten Modus überlassen, der entscheidet, wie das Video in Shots zerlegt wird. Diese Flexibilität macht es nützlich für Storyboards, kurze narrative Stücke, Montagen und Social-Media-Edits, die visuelle Vielfalt brauchen, ohne dass Sie Clips manuell zusammenfügen müssen.
Die Dauer ist vollständig anpassbar. Ein einzelnes Video kann von 3 bis 15 Sekunden dauern, mit 5 Sekunden als Standard-Startpunkt. Bei Multi-Shot-Sequenzen kann jeder einzelne Shot unabhängig getimt werden, von so kurz wie einer Sekunde bis zu 15 Sekunden, was Ihnen präzise Kontrolle über Rhythmus und Tempo im gesamten Stück gibt.
Das Framing ist ebenso flexibel. Das Modell gibt in drei Aspect Ratios aus: Breitbild 16:9 für kinematische und Landschaftsarbeiten, vertikal 9:16 für Handy-first-Plattformen wie Kurzform-Social-Videos und quadratisch 1:1 für Feeds, die ausgewogenes Framing bevorzugen. So können Sie Inhalte generieren, die speziell für das Zielformat gemacht sind, statt nachträglich zu croppen.
Für kreative Kontrolle darüber, wie genau das Modell Ihren Worten folgt, gibt es eine Prompt-Adherence-Einstellung. Stellen Sie sie höher, und das Modell hält sich enger an Ihre Beschreibung; lassen Sie sie lockerer, hat es mehr Raum zur Interpretation und eigenen Ausschmückung. Das ist praktisch, wenn Sie das Gleichgewicht zwischen präziser Anweisung und angenehmen Überraschungen einstellen möchten. Eine Negative-Prompt-Option lenkt das Modell von unerwünschten Eigenschaften ab – standardmäßig wird es angewiesen, Unschärfe, Verzerrungen und niedrige Qualität zu vermeiden – und Sie können diese Liste erweitern, um spezifische Elemente, Stile oder Artefakte auszuschließen.
Das fertige Output wird als Standard-MP4-Video-Datei geliefert, bereit zum Einwurf in einen Editor, direktes Teilen oder Kombinieren mit anderem Material. Das fotorealistische, kinematische Aussehen – mit Fokus auf Beleuchtung, Tiefe und Bewegung – macht es zu einer starken Wahl für ein breites Spektrum kreativer Arbeiten: Pitch- und Mood-Videos, atmosphärische Establishing-Shots, Produkt- und Concept-Visualisierungen, animierte Storyboards, musikgetriebene Montagen und Kurzform-Vertical-Content für Social-Plattformen.
Wer profitiert am meisten? Filmemacher und Regisseure schätzen die Multi-Shot-Struktur und kamerabewussten Prompts für Previsualization und Sequenzbau. Content-Creator und Social-Media-Produzenten erhalten plattformfertige vertikale und quadratische Formate mit bereits integriertem Sound. Designer und Concept Artists können statische Ideen in Bewegung versetzen, um zu testen, wie eine Szene wirkt. Und jeder, der mit Storytelling experimentiert, kann von einer schriftlichen Idee zu einem watchbaren Clip kommen, ohne Kamera oder Editing-Timeline anzurühren.
Ein paar Dinge, die man im Sinn behalten sollte. Sie geben entweder einen einzelnen Prompt für ein kontinuierliches Stück oder eine Multi-Shot-Liste für eine Sequenz vor – wählen Sie einen Ansatz pro Generierung, nicht beides gleichzeitig. Audio-Sprachausgabe ist am stärksten auf Englisch und Chinesisch, andere Sprachen laufen über Englisch-Übersetzung, also planen Sie gesprochene Inhalte entsprechend. Und da Prompt-Adherence und Negative Prompts das Ergebnis formen, lohnt es sich, etwas Zeit in die Verfeinerung Ihrer Beschreibungen und Ausschlüsse zu investieren, um konsistentere, zielgerichtete Clips zu erzeugen. Mit klaren, kinematischen Prompts und durchdachter Nutzung von Shot-Struktur und Timing bietet Kling v3 Standard Kreativen einen schnellen Weg von der Idee zum fertigen, tontragenden Video.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beschreibe deine Videoszene mit Bewegung, Kamerawinkeln und Stimmung
Das Modell erzeugt filmische Bewegung mit natürlicher Physik und Beleuchtung
Lade dein produktionsfertiges Video herunter und teile es
Nutzt die Fähigkeit des Modells, epische Ausblicke, volumetrische Beleuchtung und kinematische Bewegungen mit Drohnen-Style-Landschaftsfootage für horizontalen Kinocontent zu rendern.
Demonstriert reflektierende Oberflächen, dynamische Beleuchtung und Übergänge sowie stilisiertes Slow Motion für Fashion, fängt professionellen Editorial-Look mit kinematischem Flair und präziser Model-Steuerung ein.
Testet flüssige Bewegungen, Musikvideo-Choreografie, Übergänge und fantastische Atmosphäre, maximiert die Stärken des Modells in dynamischen, stilisierten Sequenzen mit Multi-Shot-Übergängen.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Wechsle noch heute zur reasoning-gesteuerten Synthese

Cinematic video from references
10 Credits

Cinematic video from references
0.4 Credits

Fast cinematic video with audio
0.1 Credits

Cinematic video with native audio
1.4 Credits

Film-grade video with audio
0.1 Credits
Text to video with audio
0.7 Credits

Fast balanced text-to-video generation
1.6 Credits