Text to video with audio
LTX-2.3 22B convierte un solo prompt escrito en un clip de video terminado completo con su propio audio sincronizado. En lugar de generar un clip silencioso y luego buscar efectos de sonido o música para superponer después, describes la escena que quieres y el modelo entrega imágenes en movimiento y sonido coincidente juntos en una sola pasada. Esto lo hace ideal para cineastas que construyen previsualizaciones rápidas, creadores de contenido que producen clips cortos para redes sociales, diseñadores de motion que exploran ideas y cualquier artista que quiera ver un concepto moverse y sonar vivo sin tocar una línea de tiempo.
En su núcleo, el modelo lee tu prompt de texto y construye un video a partir de él. Un buen prompt describe no solo lo que aparece en pantalla, sino cómo se siente — por ejemplo, "Un vaquero caminando por un pueblo polvoriento al mediodía, cámara siguiendo desde atrás, profundidad cinemática, iluminación realista, ambiente western, grano de película 4K." Cuanto más describes el ánimo, la iluminación, el comportamiento de la cámara y la textura, más cerca estará el resultado de lo que imaginaste. El modelo también puede expandir tu prompt automáticamente, llenando detalles cinemáticos para que incluso una descripción más corta produzca un shot rico y coherente.
Tienes amplio control sobre la forma y la longitud de tu clip. Los videos pueden durar desde un breve momento de 9 fotogramas hasta 481 fotogramas, y puedes establecer la tasa de fotogramas en cualquier lugar desde 1 hasta 60 fotogramas por segundo, con 24 fotogramas por segundo — el cadence clásico del cine — como predeterminado. El clip predeterminado es de 121 fotogramas de material landscape 16:9, ideal para video panorámico y redes sociales, pero puedes elegir otros encuadres para que coincidan con tu proyecto. La velocidad de reproducción y la longitud trabajan juntas, por lo que un mayor conteo de fotogramas a una tasa de fotogramas más baja te da un momento más lento y prolongado, mientras que una tasa de fotogramas más alta da movimiento más suave.
Una de las herramientas creativas destacadas es el control directo de la cámara. En lugar de esperar que el modelo interprete una frase como "push in on the subject", puedes seleccionar de un conjunto de movimientos reales de cámara: dolly in, dolly out, dolly left, dolly right, jib up, jib down, o un shot estático locked-off. Estos te dan el tipo de lenguaje de cámara deliberado y repetible en el que confían los cineastas, y puedes ajustar la intensidad del movimiento hacia arriba o abajo para que se sienta sutil o dramático. Esto hace que sea mucho más fácil obtener movimiento intencional que apoye tu narrativa en lugar de deriva aleatoria.
El audio se genera junto con el video por defecto, y puedes apagarlo si solo necesitas material silencioso. También tienes controles creativos separados para qué tan ajustado sigue el audio y el video a tu prompt, y cómo se equilibran entre sí — útil cuando quieres que el paisaje sonoro sea prominente o mantener el enfoque firmemente en las visuales.
Para ayudar con la coherencia general y el detalle fino, el modelo usa un enfoque multi-escala. Primero esboza el video a una escala menor, luego usa ese borrador para guiar un render final más grande y detallado. El resultado es una mayor consistencia y detalles más limpios que generar a tamaño completo en un solo disparo. Puedes ajustar aún más qué tan de cerca el modelo sigue tu prompt frente a cuánto libertad creativa toma, ajustar el nivel de refinamiento para un balance entre velocidad y pulido, y usar una opción de variación controlada que puede elevar la calidad en escenas difíciles.
Un prompt negativo te da una manera de dirigir al modelo lejos de apariencias que no quieres. Por defecto evita cosas como estética de caricatura y videojuegos, texto en pantalla, marcas de agua, logos, subtítulos, slow motion y material estático y plano — impulsando los resultados hacia un feel más cinemático y live-action. Puedes reescribirlo para que se ajuste a tus propios objetivos estéticos.
Cuando se trata de la salida, puedes exportar en varios formatos para adaptarse a tu flujo de trabajo: MP4 estándar, WebM, ProRes para pipelines de edición de alto nivel, o GIF animado para compartir ligero. Los niveles de calidad van desde bajo hasta máximo, y puedes sesgar el archivo hacia escritura más rápida, tamaño más pequeño o un punto medio equilibrado. Las configuraciones de aceleración te permiten intercambiar entre velocidad de generación y fidelidad dependiendo de si estás iterando rápidamente o finalizando un shot heroico.
Para reproducibilidad, puedes establecer una semilla para que el mismo prompt y configuraciones produzcan el mismo resultado — útil cuando quieres hacer cambios pequeños y controlados en lugar de empezar de cero cada vez. Un verificador de seguridad integrado está habilitado por defecto.
LTX-2.3 22B está mejor adaptado para video cinemático de corta duración: piezas de ánimo, shots de concepto, clips sociales, animatics y exploración de ideas donde tener sonido sincronizado integrado ahorra todo un paso de edición. Como los clips se miden en fotogramas y se generan como momentos autocontenidos, brilla en shots evocativos únicos en lugar de narrativas largas de múltiples escenas. Sacarle el máximo provecho se reduce a escribir prompts descriptivos y cinemáticos, elegir un movimiento de cámara intencional y dejar que el render multi-escala y el refinamiento hagan su trabajo. Con su combinación de video impulsado por prompt, audio nativo y control preciso de cámara, ofrece a los creadores un camino rápido desde una idea escrita hasta una escena en movimiento y con sonido.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Describe tu escena de video con movimiento, ángulos de cámara y ambiente
El modelo crea movimiento cinematográfico con física e iluminación naturales
Descarga y comparte tu video listo para publicar
Muestra movimiento de seguimiento sostenido, dinámicas de vehículo y generación de audio de motor en una secuencia cinemática widescreen construida para YouTube y cine.
Demuestra dinámicas de niebla atmosférica, transiciones de iluminación y audio natural inmersivo para contenido de paisaje estilo documental de Netflix.
Resalta la generación audiovisual sincronizada del modelo con sonido de multitud, iluminación de escenario dinámica y movimiento de cámara enérgico para cine landscape.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Cámbiate hoy a la síntesis guiada por razonamiento

Cinematic video from references
10 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Fast cinematic video with audio
0.1 créditos

Text to video with audio
0.3 créditos

Frontier 2K text-to-video generation
7.3 créditos

Fast balanced text-to-video generation
1.6 créditos

Cinematic video with native audio
1.4 créditos

Film-grade video with audio
0.1 créditos

Cinematic video from references
0.4 créditos