Text to video with audio
O LTX-2.3 22B transforma um único prompt escrito num clipe de vídeo acabado completo com o seu próprio áudio sincronizado. Em vez de gerar um clipe silencioso e depois procurar efeitos sonoros ou música para sobrepor depois, descreve a cena que quer e o modelo entrega imagens em movimento e som correspondente juntos numa única passada. Isso torna-o uma forte opção para cineastas a construir previsualizações rápidas, criadores de conteúdo a produzir clipes sociais curtos, designers de movimento a explorar ideias e qualquer artista que queira ver um conceito mover-se e soar vivo sem tocar numa linha temporal.
No seu núcleo, o modelo lê o seu prompt de texto e constrói um vídeo a partir dele. Um bom prompt descreve não só o que aparece no ecrã, mas como se sente — por exemplo, "A cowboy walking through a dusty town at high noon, camera following from behind, cinematic depth, realistic lighting, western mood, 4K film grain." Quanto mais descrever ambiente, iluminação, comportamento da câmara e textura, mais próximo o resultado fica do que imaginou. O modelo também pode expandir o seu prompt automaticamente, preenchendo detalhes cinematográficos para que mesmo uma descrição mais curta produza um plano rico e coerente.
Tem amplo controlo sobre a forma e duração do seu clipe. Os vídeos podem durar desde um momento breve de 9 frames até 481 frames, e pode definir a taxa de frames desde 1 até 60 frames por segundo, com 24 frames por segundo — o ritmo clássico de filme — como padrão. O clipe padrão é de 121 frames em formato landscape 16:9, uma opção natural para ecrãs largos e vídeo social, mas pode escolher outros enquadramentos para o seu projeto. A velocidade de reprodução e a duração trabalham em conjunto, pelo que uma contagem de frames mais longa a uma taxa de frames mais baixa lhe dá um momento mais lento e prolongado, enquanto uma taxa mais alta dá movimento mais suave.
Uma das ferramentas criativas de destaque é o controlo direto da câmara. Em vez de esperar que o modelo interprete uma frase como "push in on the subject", pode selecionar de um conjunto de movimentos reais de câmara: dolly in, dolly out, dolly left, dolly right, jib up, jib down ou um plano estático locked-off. Estes dão-lhe a linguagem deliberada e repetível de câmara de que os cineastas dependem, e pode ajustar a intensidade do movimento para cima ou para baixo para que seja subtil ou dramático. Isso torna muito mais fácil obter movimento intencional que apoie a sua narrativa em vez de deriva aleatória.
O áudio é gerado ao lado do vídeo por padrão, e pode desligá-lo se só precisar de footage silencioso. Tem também controlos criativos separados para o grau de adesão do áudio e do vídeo ao seu prompt, e para o equilíbrio entre os dois — útil quando quer que a paisagem sonora seja proeminente ou quer manter o foco firmemente nas imagens.
Para ajudar na coerência geral e no detalhe fino, o modelo usa uma abordagem multi-scale. Primeiro esboça o vídeo a uma escala menor, depois usa esse rascunho para guiar um render final maior e mais detalhado. O resultado é maior consistência e detalhe mais limpo do que gerar em tamanho completo numa única passada. Pode ajustar ainda mais o quão de perto o modelo segue o seu prompt em oposição à liberdade criativa que toma, regular o nível de refinamento para um equilíbrio entre velocidade e polimento, e usar uma opção de variação controlada que pode elevar a qualidade em cenas difíceis.
Um negative prompt dá-lhe uma forma de afastar o modelo de aparências que não quer. Por padrão, evita coisas como estética de cartoon e vídeo-jogo, texto no ecrã, marcas de água, logótipos, legendas, slow motion e footage estático e plano — guiando os resultados para uma sensação mais cinematográfica e live-action. Pode reescrever isto para se adequar aos seus próprios objetivos estéticos.
No que toca à saída, pode exportar em vários formatos para se adequar ao seu fluxo de trabalho: MP4 padrão, WebM, ProRes para pipelines de edição de topo, ou GIF animado para partilha leve. Os níveis de qualidade vão de baixo até máximo, e pode enviesar o ficheiro para escrita mais rápida, tamanho menor ou um meio equilibrado. As definições de aceleração permitem trocar entre velocidade de geração e fidelidade dependendo se está a iterar rapidamente ou a finalizar um plano hero.
Para reprodutibilidade, pode definir uma seed para que o mesmo prompt e definições produzam o mesmo resultado — útil quando quer fazer pequenas alterações controladas em vez de começar do zero cada vez. Um verificador de segurança integrado está ativado por padrão.
O LTX-2.3 22B é mais adequado a vídeo cinematográfico de curta duração: peças de ambiente, planos de conceito, clipes sociais, animatics e exploração de ideias onde ter som sincronizado incorporado poupa um passo inteiro de edição. Como os clipes são medidos em frames e gerados como momentos autónomos, brilha em planos únicos evocativos em vez de narrativas longas e multi-cena. Obter o máximo dele resume-se a escrever prompts descritivos e cinematográficos, escolher um movimento intencional de câmara e deixar o render multi-scale e o refinamento fazerem o seu trabalho. Com a sua combinação de vídeo guiado por prompt, áudio nativo e controlo preciso de câmara, dá aos criadores um caminho rápido de uma ideia escrita para uma cena em movimento e com som.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descreva a cena do seu vídeo com movimento, ângulos de câmara e ambiente
O modelo cria movimento cinematográfico com física e iluminação naturais
Transfira e partilhe o seu vídeo pronto para produção
Mostra movimento de tracking sustentado, dinâmicas de veículo e geração de áudio de motor numa sequência cinematográfica widescreen para YouTube e cinema.
Demonstra dinâmicas de nevoeiro atmosférico, transições de iluminação e áudio natural imersivo para conteúdo de paisagem de documentário estilo Netflix.
Destaca a geração audiovisual sincronizada do modelo com som de multidão, iluminação de palco dinâmica e movimento energético de câmara para cinema landscape.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Mude hoje para a síntese guiada por raciocínio

Fast cinematic video with audio
0.1 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Text to video with audio
0.3 créditos

Cinematic video with native audio
1.4 créditos

Frontier 2K text-to-video generation
7.3 créditos

Film-grade video with audio
0.1 créditos

Cinematic video from references
0.4 créditos

Fast balanced text-to-video generation
1.6 créditos

Cinematic video from references
10 créditos