Cinematic text-to-video with audio
O Kling Video v3 Standard transforma descrições escritas em vídeo cinematográfico, completo com movimento fluido e credível e som gerados diretamente ao lado da imagem. Construído para criadores que querem mais do que uma única imagem em movimento, produz clipes polidos que parecem dirigidos em vez de montados aleatoriamente — com movimento de câmara, iluminação e ritmo que parecem filmagens reais.
No seu núcleo, trata-se de um modelo de texto para vídeo: descreve a cena que deseja e ele renderiza-a. Um prompt como uma tomada de drone cinematográfica a voar através de ruínas de pedra cobertas de musgo ao pôr do sol dourado, subindo através de arcos em ruínas para revelar um vale enevoado com raios de luz volumétricos, é exatamente o tipo de direção em camadas e consciente da câmara que o modelo foi concebido para interpretar. Gerencia atmosfera, escala e detalhe fotorrealista, tornando-o bem adequado para cineastas a construir planos de estabelecimento, artistas de conceito a visualizar mundos e criadores de conteúdo que precisam de b-roll impressionante sob demanda.
Uma das características destacadas é a geração nativa de áudio. Em vez de adicionar som num passo separado, o modelo pode produzir áudio como parte da mesma geração, pelo que o clipe final chega com som correspondente integrado. A saída de voz é suportada em chinês e inglês, e outras línguas são automaticamente traduzidas para inglês. Para resultados falados mais limpos, recomenda-se escrever fala em inglês em minúsculas e reservar maiúsculas para acrónimos ou nomes próprios para que sejam pronunciados corretamente. Se preferir um clipe silencioso — por exemplo, quando planeia pontuar ou editar o som sozinho —, a geração de áudio pode simplesmente ser desligada.
O suporte a multi-tomada é onde o Kling v3 Standard se distingue realmente dos geradores de clipe único. Em vez de uma tomada contínua, pode construir um vídeo a partir de várias tomadas distintas, cada uma com a sua própria descrição e duração. Isto permite esboçar uma curta sequência — uma tomada ampla de abertura, um detalhe mais próximo, uma revelação — e o modelo costurá-las num vídeo coerente. Pode dispor estas tomadas manualmente para controlo total, ou entregar a estrutura a um modo inteligente que decide como dividir o vídeo em tomadas automaticamente. Essa flexibilidade torna-o útil para storyboards, peças narrativas curtas, montagens e edições para redes sociais que precisam de variedade visual sem montar clipes manualmente.
A duração é totalmente ajustável. Um único vídeo pode ter entre 3 e 15 segundos, com 5 segundos como ponto de partida padrão. Ao construir sequências multi-tomada, cada tomada individual pode ser cronometrada de forma independente, desde tão curta quanto um segundo até quinze, dando-lhe controlo apertado sobre o ritmo e o andamento em toda a peça.
O enquadramento é igualmente flexível. O modelo produz em três rácios de aspeto: ecrã largo 16:9 para trabalho cinematográfico e paisagem, vertical 9:16 para plataformas mobile-first como vídeo curto para redes sociais, e quadrado 1:1 para feeds que favorecem enquadramento equilibrado. Isto significa que pode gerar conteúdo construído especificamente para o destino em vez de cortar depois.
Para controlo criativo sobre o quão fielmente o modelo segue as suas palavras, existe uma definição de aderência ao prompt. Aumente-a e o modelo segue mais de perto a sua descrição; diminua-a e tem mais espaço para interpretar e adicionar os seus próprios floreados. Isto é útil quando quer ajustar o equilíbrio entre direção precisa e surpresas agradáveis. Uma opção de prompt negativo permite direcionar o modelo para longe de qualidades indesejadas — por defeito, é instruído a evitar borrão, distorção e baixa qualidade — e pode expandir essa lista para excluir elementos, estilos ou artefactos específicos que não quer que apareçam.
A saída final é entregue como ficheiro de vídeo MP4 padrão, pronto para inserir num editor, partilhar diretamente ou combinar com outras filmagens. O aspeto fotorrealista e cinematográfico — com atenção à iluminação, profundidade e movimento — torna-o uma forte opção para uma vasta gama de trabalho criativo: vídeos de pitch e ambiente, planos de estabelecimento atmosféricos, visualizações de produtos e conceitos, storyboards animados, montagens guiadas por música e conteúdo vertical curto para plataformas sociais.
Quem beneficia mais? Cineastas e realizadores apreciarão a estrutura multi-tomada e o prompting consciente da câmara para pré-visualização e construção de sequências. Criadores de conteúdo e produtores de redes sociais obtêm formatos vertical e quadrado prontos para plataformas com som já anexado. Designers e artistas de conceito podem trazer ideias estáticas para movimento para testar como uma cena se sente. E qualquer pessoa a experimentar com narrativa pode passar de uma ideia escrita para um clipe assistível sem tocar numa câmara ou numa linha temporal de edição.
Algumas coisas a ter em mente. Fornece ou um único prompt para uma peça contínua ou uma lista multi-tomada para uma sequência — escolhe uma abordagem por geração, não ambas ao mesmo tempo. A saída de voz em áudio é mais forte em inglês e chinês, com outras línguas roteadas através de tradução para inglês, pelo que planeie o seu conteúdo falado em conformidade. E porque a aderência ao prompt e os prompts negativos moldam o resultado, gastar um pouco de tempo a refinar as suas descrições e exclusões tende a produzir clipes mais consistentes e no alvo. Com prompting cinematográfico claro e uso pensativo da estrutura de tomadas e temporização, o Kling v3 Standard dá aos criadores um caminho rápido de uma ideia para um vídeo final com som.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descreva a cena do seu vídeo com movimento, ângulos de câmara e ambiente
O modelo cria movimento cinematográfico com física e iluminação naturais
Transfira e partilhe o seu vídeo pronto para produção
Explora a capacidade do modelo para renderizar vistas épicas, iluminação volumétrica e movimento cinematográfico com filmagens de paisagem em estilo drone ideal para conteúdo horizontal cinematográfico.
Demonstra superfícies reflexivas, iluminação e transições dinâmicas e câmara lenta estilizada para moda, capturando um aspeto editorial profissional com flair cinematográfico e direção precisa do modelo.
Testa movimento fluido, coreografia de videoclipe, transições e atmosfera fantástica, maximizando as forças do modelo em sequências dinâmicas e estilizadas com transições multi-tomada.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Mude hoje para a síntese guiada por raciocínio

Cinematic video from references
0.4 créditos

Cinematic video with native audio
1.4 créditos
Text to video with audio
0.7 créditos

Fast balanced text-to-video generation
1.6 créditos

Fast cinematic video with audio
0.1 créditos

Film-grade video with audio
0.1 créditos

Cinematic video from references
10 créditos