Cinematic text-to-video with audio
Kling Video v3 Standard converteix descripcions escrites en vídeo cinematogràfic, complet amb moviment fluid i creïble i so generat just al costat de la imatge. Dissenyat per a creadors que volen més que una sola imatge en moviment, produeix clips polits que semblen dirigits en lloc d'assemblats a l'atzar: amb moviment de càmera, il·luminació i ritme que semblen rodatges reals.
Al seu nucli, es tracta d'un model text-to-video: descrius l'escena que vols i l'interpreta. Un prompt com un pla de dron cinematogràfic volant a través de ruïnes de pedra cobertes de molsa a l'hora daurada, elevant-se a través d'arcs enrunats per revelar un vall brumós amb raigs de llum volumètrics, és exactament el tipus de direcció en capes i conscient de la càmera que el model està dissenyat per interpretar. Gestiona l'atmosfer, l'escala i els detalls fotorealistes, fent-lo ideal per a cineastes que construeixen plans d'establiment, artistes de conceptes que visualitzen mons i creadors de continguts que necessiten b-roll impactant sota demanda.
Una de les característiques principals és la generació d'àudio natiu. En lloc d'afegir so en un pas separat, el model pot produir àudio com a part de la mateixa generació, per la qual cosa el clip final arriba amb so coincident integrat. La sortida de veu funciona en xinès i anglès, i altres idiomes es tradueixen automàticament a l'anglès. Per obtenir els millors resultats parlats, es recomana escriure el discurs en anglès en minúscules i reservar les majúscules per a acrònims o noms propis perquè es pronunciïn correctament. Si prefereixes un clip silenciós —per exemple, quan planeges afegir música o editar el so tu mateix—, la generació d'àudio es pot apagar simplement.
El suport multi-shot és on Kling v3 Standard es distingeix realment dels generadors de clip únic. En lloc d'un sol pla continu, pots construir un vídeo a partir de diversos plans diferents, cadascun amb la seva pròpia descripció i durada. Això et permet esbossar una seqüència curta —un pla obert inicial, un detall més proper, una revelació— i que el model els uneixi en un vídeo coherent. Pots disposar aquests plans tu mateix per a un control total o delegar l'estructura a un mode intel·ligent que decideix com dividir el vídeo en plans automàticament. Aquesta flexibilitat el fa útil per a storyboards, peces narratives curtes, montatges i edicions per a xarxes socials que necessiten varietat visual sense muntar clips manualment.
La durada és totalment ajustable. Un vídeo únic pot durar des de 3 fins a 15 segons, amb 5 segons com a punt de partida estàndard. Quan construeixes seqüències multi-shot, cada pla individual es pot cronometrar independentment, des d'un segon tan curt fins a quinze, donant-te un control estret sobre el ritme i el pacing de tota la peça.
L'enquadrament és igualment flexible. El model genera en tres relacions d'aspecte: 16:9 panoràmic per a treballs cinematogràfics i paisatges, 9:16 vertical per a plataformes mòbils com vídeos curts de xarxes socials, i 1:1 quadrat per a feeds que afavoreixen enquadrament equilibrat. Això significa que pots generar contingut dissenyat específicament per al destí en lloc de retallar després.
Per al control creatiu sobre la fidelitat amb què el model segueix les teves paraules, hi ha una configuració d'adherència al prompt. Augmenta-la i el model s'atenen més estretament a la teva descripció; redueix-la i té més marge per interpretar i afegir els seus propis floritures. Això és útil quan vols ajustar l'equilibri entre direcció precisa i sorpreses agradables. L'opció de prompt negatiu et permet dirigir el model lluny de qualitats no desitjades —per defecte se li diu que eviti borrositat, distorsió i baixa qualitat— i pots expandir aquesta llista per excloure elements, estils o artefactes específics que no vulguis que apareguin.
La sortida final es lliura com un fitxer de vídeo MP4 estàndard, a punt per inserir en un editor, compartir directament o combinar amb altres imatges. L'aspecte fotorealista i cinematogràfic —amb atenció a l'il·luminació, profunditat i moviment— el converteix en una opció sòlida per a una àmplia gamma de treballs creatius: vídeos de pitch i ambient, plans d'establiment atmosfèrics, visualitzacions de productes i conceptes, storyboards animats, montatges amb música i contingut vertical curt per a plataformes socials.
Qui en beneficia més? Els cineastes i directors apreciaran l'estructura multi-shot i el prompting conscient de la càmera per a previsualització i construcció de seqüències. Els creadors de continguts i productors de xarxes socials obtindran formats verticals i quadrats a punt per a la plataforma amb so ja adjunt. Els dissenyadors i artistes de conceptes poden portar idees estàtiques al moviment per provar com se sent una escena. I qualsevol que experimenti amb narracions pot passar d'una idea escrita a un clip mirable sense tocar una càmera ni una línia de temps d'edició.
Algunes coses a tenir en compte. Proporcioneu un únic prompt per a una peça contínua o una llista multi-shot per a una seqüència —escollint un enfocament per generació, no tots dos alhora. La sortida de veu en àudio és més potent en anglès i xinès, amb altres idiomes routats a través de la traducció a l'anglès, així que planegeu el vostre contingut parlat en conseqüència. I com que l'adherència al prompt i els prompts negatius modelen el resultat, dedicar una mica de temps a refinar les vostres descripcions i exclusions sol produir clips més consistents i precisos. Amb prompting cinematogràfic clar i un ús pensat de l'estructura i el timing dels plans, Kling v3 Standard ofereix als creadors un camí ràpid des d'una idea fins a un vídeo final amb so.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descriu l'escena del teu vídeo amb moviment, angles de càmera i ambient
El model crea moviment cinematogràfic amb física i il·luminació naturals
Descarrega i comparteix el teu vídeo a punt per publicar
Aprofita la capacitat del model per renderitzar vistes èpiques, il·luminació volumètrica i moviment cinematogràfic amb imatges de paisatge en estil dron ideals per a contingut horitzontal cinematogràfic.
Demostra superfícies reflectants, il·luminació i transicions dinàmiques, i càmera lenta estilitzada per a moda, capturant un aspecte editorial professional amb flair cinematogràfic i direcció precisa del model.
Prova moviment fluid, coreografia de videoclip, transicions i atmosfera fantàstica, maximitzant les fortaleses del model en seqüències dinàmiques i estilitzades amb transicions multi-shot.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passa't avui a la síntesi guiada per raonament

Cinematic video from references
0.4 crèdits

Multi-shot cinematic text-to-video
4 crèdits
Text to video with audio
0.7 crèdits

Cinematic video with native audio
1.4 crèdits

Film-grade video with audio
0.1 crèdits

Cinematic video from references
10 crèdits

Fast cinematic video with audio
0.1 crèdits

Fast balanced text-to-video generation
1.6 crèdits