Text to video with audio
LTX-2.3 22B transforma um único prompt escrito em um clipe de vídeo finalizado completo com seu próprio áudio sincronizado. Em vez de gerar um clipe silencioso e depois procurar efeitos sonoros ou música para sobrepor depois, você descreve a cena que deseja e o modelo entrega imagens em movimento e som correspondente juntos em uma única passada. Isso o torna uma ótima opção para cineastas criando pré-visualizações rápidas, criadores de conteúdo produzindo clipes curtos para redes sociais, designers de motion explorando ideias e qualquer artista que queira ver um conceito se mover e soar vivo sem mexer em uma linha do tempo.
No cerne, o modelo lê seu prompt de texto e constrói um vídeo a partir dele. Um bom prompt descreve não apenas o que aparece na tela, mas como se sente — por exemplo, "Um cowboy caminhando por uma cidade empoeirada ao meio-dia, câmera seguindo por trás, profundidade cinematográfica, iluminação realista, clima western, 4K film grain." Quanto mais você descrever clima, iluminação, comportamento da câmera e textura, mais próximo o resultado ficará do que você imaginou. O modelo também pode expandir seu prompt automaticamente, preenchendo detalhes cinematográficos para que mesmo uma descrição mais curta produza um take rico e coerente.
Você tem amplo controle sobre a forma e o comprimento do seu clipe. Os vídeos podem ter de um breve momento de 9 frames até 481 frames, e você define a taxa de frames de 1 até 60 frames por segundo, com 24 frames por segundo — o ritmo clássico de filme — como padrão. O clipe padrão tem 121 frames em landscape 16:9, ideal para widescreen e vídeo social, mas você pode escolher outros enquadramentos para combinar com seu projeto. Velocidade de reprodução e comprimento funcionam juntos, então uma contagem maior de frames com taxa menor dá um momento mais lento e prolongado, enquanto uma taxa maior proporciona movimento mais suave.
Uma das ferramentas criativas de destaque é o controle direto da câmera. Em vez de esperar que o modelo interprete uma frase como "push in on the subject", você pode selecionar de um conjunto de movimentos reais de câmera: dolly in, dolly out, dolly left, dolly right, jib up, jib down ou um take estático locked-off. Isso dá o tipo de linguagem de câmera deliberada e repetível de que os cineastas dependem, e você pode ajustar a intensidade do movimento para cima ou para baixo, tornando-o sutil ou dramático. Isso facilita muito obter movimento intencional que apoie sua narrativa em vez de deriva aleatória.
O áudio é gerado junto com o vídeo por padrão, e você pode desativá-lo se precisar apenas de material silencioso. Você também tem controles criativos separados para quão fielmente o áudio e o vídeo seguem seu prompt, e como eles se equilibram entre si — útil quando você quer que a paisagem sonora seja proeminente ou manter o foco firmemente nas visuais.
Para ajudar na coerência geral e nos detalhes finos, o modelo usa uma abordagem multi-escala. Ele primeiro esboça o vídeo em escala menor, depois usa esse rascunho para guiar um render final maior e mais detalhado. O resultado é maior consistência e detalhes mais limpos do que gerar em tamanho total de uma só vez. Você pode ajustar ainda mais quão fielmente o modelo segue seu prompt em oposição à liberdade criativa que toma, regular o nível de refinamento para um equilíbrio entre velocidade e polimento, e usar uma opção de variação controlada que pode elevar a qualidade em cenas difíceis.
Um negative prompt dá uma maneira de direcionar o modelo para longe de visuais que você não quer. Por padrão, ele evita coisas como estética de cartoon e videogame, texto na tela, marcas d'água, logotipos, legendas, slow motion e material estático e plano — direcionando os resultados para uma sensação mais cinematográfica e live-action. Você pode reescrevê-lo para se adequar aos seus próprios objetivos estéticos.
Quanto à saída, você pode exportar em vários formatos para se adequar ao seu fluxo de trabalho: MP4 padrão, WebM, ProRes para pipelines de edição high-end ou GIF animado para compartilhamento leve. Níveis de qualidade vão de baixo até máximo, e você pode inclinar o arquivo para escrita mais rápida, tamanho menor ou um meio equilibrado. Configurações de aceleração permitem trocar entre velocidade de geração e fidelidade dependendo se você está iterando rapidamente ou finalizando um hero shot.
Para reprodutibilidade, você pode definir uma seed para que o mesmo prompt e configurações produzam o mesmo resultado — útil quando você quer fazer mudanças pequenas e controladas em vez de começar do zero toda vez. Um verificador de segurança integrado está ativado por padrão.
LTX-2.3 22B é mais adequado para vídeos cinematográficos curtos: peças de clima, takes de conceito, clipes sociais, animatics e exploração de ideias onde ter som sincronizado já incorporado economiza uma etapa inteira de edição. Como os clipes são medidos em frames e gerados como momentos autônomos, ele brilha em takes únicos evocativos em vez de narrativas longas e multi-cenas. Obter o máximo dele resume-se a escrever prompts descritivos e cinematográficos, escolher um movimento de câmera intencional e deixar o render multi-escala e refinamento fazerem seu trabalho. Com sua combinação de vídeo impulsionado por prompt, áudio nativo e controle preciso de câmera, ele oferece aos criadores um caminho rápido de uma ideia escrita para uma cena em movimento e com som.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descreva a cena do seu vídeo com movimento, ângulos de câmera e clima
O modelo cria movimento cinematográfico com física e iluminação naturais
Baixe e compartilhe seu vídeo pronto para produção
Mostra movimento de tracking sustentado, dinâmica de veículos e geração de áudio de motor em uma sequência cinematográfica widescreen para YouTube e cinema.
Demonstra dinâmica de névoa atmosférica, transições de iluminação e áudio natural imersivo para conteúdo de paisagem no estilo Netflix.
Destaca a geração audiovisual sincronizada do modelo com som de multidão, iluminação de palco dinâmica e movimento de câmera enérgico para cinema landscape.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Mude para a síntese guiada por raciocínio hoje mesmo

Text to video with audio
0.3 créditos

Cinematic video with native audio
1.4 créditos

Frontier 2K text-to-video generation
7.3 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Fast balanced text-to-video generation
1.6 créditos

Film-grade video with audio
0.1 créditos

Cinematic video from references
10 créditos

Cinematic video from references
0.4 créditos

Fast cinematic video with audio
0.1 créditos