Cinematic text-to-video with audio
Kling Video v3 Standard transforme les descriptions écrites en vidéos cinématographiques, complètes avec des mouvements fluides et crédibles ainsi qu'un son généré directement en même temps que l'image. Conçu pour les créateurs qui veulent plus qu'une simple image en mouvement, il produit des clips polis qui semblent dirigés plutôt qu'assemblés au hasard — avec des mouvements de caméra, un éclairage et un rythme qui ressemblent à de vraies prises de vue.
Au cœur, il s'agit d'un modèle texte-vidéo : vous décrivez la scène souhaitée, et il la rend. Un prompt comme un plan de drone cinématographique survolant des ruines de pierre couvertes de mousse à l'heure dorée, s'élevant à travers des arches en ruine pour révéler une vallée brumeuse avec des rayons de lumière volumétriques, est exactement le type de direction multicouche et consciente de la caméra que le modèle est conçu pour interpréter. Il gère l'atmosphère, l'échelle et les détails photoréalistes, ce qui le rend parfaitement adapté aux cinéastes construisant des plans d'établissement, aux artistes conceptuels visualisant des mondes, et aux créateurs de contenu ayant besoin de b-roll frappants à la demande.
L'une des fonctionnalités phares est la génération audio native. Plutôt que d'ajouter le son dans une étape séparée, le modèle peut produire l'audio dans la même génération, de sorte que le clip final arrive avec un son correspondant intégré. La sortie vocale est prise en charge en chinois et en anglais, et les autres langues sont automatiquement traduites en anglais. Pour les résultats parlés les plus nets, il est recommandé d'écrire la parole anglaise en minuscules, et de réserver les majuscules pour les acronymes ou noms propres afin qu'ils soient prononcés correctement. Si vous préférez un clip silencieux — par exemple, lorsque vous prévoyez de composer ou monter le son vous-même — la génération audio peut simplement être désactivée.
Le support multi-plan est là où Kling v3 Standard se distingue vraiment des générateurs de clips uniques. Au lieu d'une seule prise continue, vous pouvez construire une vidéo à partir de plusieurs plans distincts, chacun avec sa propre description et sa propre durée. Cela vous permet d'esquisser une courte séquence — un plan large d'ouverture, un détail plus proche, une révélation — et de laisser le modèle les assembler en une vidéo cohérente. Vous pouvez disposer ces plans vous-même pour un contrôle total, ou confier la structure à un mode intelligent qui décide comment diviser la vidéo en plans de lui-même. Cette flexibilité le rend utile pour le storyboarding, les courtes pièces narratives, les montages, et les éditions pour réseaux sociaux qui nécessitent une variété visuelle sans assembler les clips manuellement.
La durée est entièrement ajustable. Une vidéo unique peut durer de 3 à 15 secondes, avec 5 secondes comme point de départ standard. Lors de la construction de séquences multi-plan, chaque plan individuel peut être minuté indépendamment, d'aussi court que une seconde jusqu'à quinze, vous donnant un contrôle précis sur le rythme et le pacing de l'ensemble.
Le cadrage est tout aussi flexible. Le modèle sort en trois ratios d'aspect : 16:9 grand écran pour les travaux cinématographiques et paysage, 9:16 vertical pour les plateformes mobiles en premier comme la vidéo sociale courte, et 1:1 carré pour les flux qui favorisent un cadrage équilibré. Cela signifie que vous pouvez générer du contenu spécialement conçu pour la destination plutôt que de recadrer après coup.
Pour un contrôle créatif sur la fidélité avec laquelle le modèle suit vos mots, il y a un réglage d'adhésion au prompt. Augmentez-le et le modèle colle plus étroitement à votre description ; diminuez-le et il a plus de marge pour interpréter et ajouter ses propres embellissements. C'est pratique quand vous voulez ajuster l'équilibre entre direction précise et surprises agréables. Une option de negative prompt permet de diriger le modèle loin des qualités indésirables — par défaut, il évite le flou, la distorsion et la basse qualité — et vous pouvez étendre cette liste pour exclure des éléments spécifiques, styles ou artefacts que vous ne voulez pas voir apparaître.
La sortie finale est livrée sous forme de fichier vidéo MP4 standard, prêt à être inséré dans un éditeur, partagé directement, ou combiné avec d'autres images. Le look photoréaliste et cinématographique — avec attention à l'éclairage, la profondeur et le mouvement — en fait un excellent choix pour une large gamme de travaux créatifs : vidéos de pitch et d'ambiance, plans d'établissement atmosphériques, visualisations de produits et concepts, storyboards animés, montages pilotés par la musique, et contenu vertical court pour les plateformes sociales.
Qui en bénéficie le plus ? Les cinéastes et réalisateurs apprécieront la structure multi-plan et les prompts conscients de la caméra pour la prévisualisation et la construction de séquences. Les créateurs de contenu et producteurs pour réseaux sociaux obtiennent des formats vertical et carré prêts pour les plateformes avec son déjà attaché. Les designers et artistes conceptuels peuvent animer des idées statiques pour tester la sensation d'une scène. Et quiconque expérimente le storytelling peut passer d'une idée écrite à un clip regardable sans toucher une caméra ou une timeline d'édition.
Quelques points à garder à l'esprit. Vous fournissez soit un seul prompt pour une pièce continue, soit une liste multi-plan pour une séquence — vous choisissez une approche par génération, pas les deux à la fois. La sortie vocale audio est la plus performante en anglais et chinois, les autres langues passant par une traduction en anglais, alors planifiez votre contenu parlé en conséquence. Et comme l'adhésion au prompt et les negative prompts façonnent le résultat, passer un peu de temps à raffiner vos descriptions et exclusions produit généralement des clips plus cohérents et ciblés. Avec des prompts clairs et cinématographiques et une utilisation réfléchie de la structure des plans et du timing, Kling v3 Standard offre aux créateurs un chemin rapide d'une idée à une vidéo finie avec son intégré.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Décrivez votre scène vidéo avec le mouvement, les angles de caméra et l'ambiance
Le modèle crée un mouvement cinématographique avec une physique et un éclairage naturels
Téléchargez et partagez votre vidéo prête à la diffusion
Exploite la capacité du modèle à rendre des vistas épiques, éclairage volumétrique et mouvement cinématographique avec des plans paysage style drone idéaux pour du contenu horizontal ciné.
Démontre surfaces réfléchissantes, éclairage et transitions dynamiques, et slow motion stylisé pour la mode, capturant un look éditorial professionnel avec panache ciné et direction précise du modèle.
Teste mouvements fluides, chorégraphie clip musical, transitions et atmosphère fantastique, maximisant les forces du modèle en séquences dynamiques et stylisées avec transitions multi-plans.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passez dès aujourd'hui à la synthèse guidée par le raisonnement

Cinematic video with native audio
1.4 crédits

Fast balanced text-to-video generation
1.6 crédits

Cinematic video from references
0.4 crédits

Cinematic video from references
10 crédits

Fast cinematic video with audio
0.1 crédits
Text to video with audio
0.7 crédits

Film-grade video with audio
0.1 crédits