Cinematic image-to-video with audio
Kling Video v3 Image to Video [Standard] transforma una sola imagen estática en un clip de vídeo cinematográfico en movimiento completo con su propio audio generado de forma nativa. Proporciona una imagen inicial y una descripción textual del movimiento deseado, y produce imágenes fluidas y suaves que dan vida a la escena con un pulido visual premium. Ya sea que estés animando fotos de productos, ilustraciones, retratos o paisajes, este modelo está diseñado para ofrecer ese aspecto cinematográfico y movimiento continuo que antes requería un montaje de producción completo.
En su núcleo, el modelo toma tu imagen inicial y un prompt de texto que describe cómo debe moverse la escena. Puedes pedir que la cámara orbite lentamente alrededor de un sujeto, que la luz suave se desplace por una superficie, que la hierba se meza suavemente o que las sombras se muevan elegantemente por el encuadre. El resultado es un vídeo con movimiento suave y continuo, y una sensación genuinamente premium. Como el modelo interpreta tanto tu imagen como tus palabras, mantienes el control creativo sobre el ritmo, el comportamiento de la cámara y la atmósfera.
Una de las características destacadas es la generación nativa de audio. En lugar de añadir sonido en un paso de edición separado, el modelo puede producir audio directamente junto con el vídeo. Soporta salida de voz en chino e inglés, y otros idiomas se traducen automáticamente al inglés. Cuando quieras voz en inglés, escribir en minúsculas produce un habla natural, mientras que las mayúsculas se reservan para acrónimos o nombres propios para que se pronuncien correctamente. Si prefieres un clip silencioso, puedes desactivar simplemente el audio y mantener las imágenes por sí solas.
El modelo te ofrece un control significativo sobre la duración. Puedes generar clips desde 3 segundos hasta un máximo de 15 segundos, con un valor predeterminado de 5 segundos. Las duraciones cortas son ideales para bucles rápidos, fragmentos para redes sociales y tomas de belleza de productos, mientras que las más largas te permiten construir una secuencia más desarrollada o contar una pequeña historia en una sola generación.
Para proyectos más ambiciosos, el modelo soporta generación de vídeo multi-shot. En lugar de un solo prompt, puedes proporcionar una serie de prompts que dividen tu vídeo en múltiples tomas, permitiéndote guionizar una secuencia de momentos distintos dentro de un mismo clip. Puedes dirigir exactamente cómo se estructuran esas tomas tú mismo, o dejar las riendas al modelo para que determine inteligentemente la estructura de las tomas por sí solo. Esto hace posible ir más allá de una sola toma continua y crear algo más cercano a una escena editada.
Otra capacidad potente es el soporte para elementos personalizados. Puedes alimentar al modelo con personajes u objetos específicos que quieras que aparezcan en el vídeo y referenciarlos directamente en tu prompt usando etiquetas simples como @Element1 o @Element2. Cada elemento se puede definir ya sea mediante un conjunto de imágenes —una imagen frontal principal más de una a tres imágenes de referencia adicionales desde diferentes ángulos— o mediante un vídeo de referencia corto. Esto te permite mantener un personaje, producto u objeto consistente y reconocible a lo largo de tus imágenes generadas, lo cual es invaluable para trabajos de marca, personajes recurrentes y narrativas.
El modelo también te permite guiar el final de tu clip. Junto con tu imagen inicial, puedes proporcionar opcionalmente una imagen final, dando al modelo un objetivo hacia el que moverse. Esto es útil cuando quieres que el movimiento resuelva en una composición o pose específica, en lugar de dejar el final al azar.
Varios controles creativos te ayudan a ajustar exactamente el aspecto que deseas. Una configuración de adherencia al prompt determina cuán fielmente se ciñe el modelo a tu descripción escrita frente a cuánto margen creativo toma —valores bajos permiten más interpretación, valores altos lo mantienen alineado estrictamente con tus palabras. También puedes usar un prompt negativo para alejar al modelo de cualidades no deseadas; por defecto evita desenfoque, distorsión y baja calidad, y puedes añadir tus propios términos para excluir otras cosas que no quieras ver.
Este modelo es ideal para una amplia gama de profesionales creativos. Cineastas y diseñadores de motion pueden prototipar tomas cinematográficas y movimientos de cámara sin necesidad de un equipo de grabación. Marketers y diseñadores de productos pueden animar fotografía estática de productos en clips promocionales llamativos. Ilustradores y artistas conceptuales pueden dar movimiento a su arte estático. Creadores de contenido social pueden producir vídeos cortos pulidos con sonido integrado. Y cualquiera que trabaje en piezas narrativas puede apoyarse en la generación multi-shot y elementos personalizados para mantener personajes y escenas consistentes a lo largo de una secuencia.
En cuanto a lo que produce, la salida es un archivo de vídeo MP4 estándar que es fácil de descargar, compartir o insertar en una edición mayor. El énfasis está en visuales cinematográficos y movimiento fluido y creíble —el modelo está afinado para que las superficies capten la luz de forma convincente, los objetos se muevan de manera natural y el clip general se sienta intencional y refinado en lugar de nervioso o artificial.
Hay algunas cosas que vale la pena tener en cuenta al trabajar. Proporcionas ya sea un solo prompt o una secuencia multi-prompt, pero no ambos a la vez, así que decide de antemano si quieres una toma continua o una estructura multi-shot. Los elementos personalizados necesitan material de referencia claro —para elementos basados en imágenes, una vista frontal más ángulos adicionales ayudan al modelo a entender completamente el sujeto. Al usar audio con voz, seguir la guía de minúsculas para habla y mayúsculas para acrónimos te dará la salida de voz más limpia. Y como con cualquier herramienta generativa, un prompt descriptivo y específico sobre movimiento de cámara, iluminación y ritmo te acercará notablemente al resultado que imaginas. Con prompts pensados y el rico conjunto de controles del modelo, puedes pasar de un solo fotograma a un clip final cinematográfico con sonido en un solo paso.
Add the image that you want change
Añade una imagen opcional para guiar el aspecto, el personaje o el entorno
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Escribe un prompt: el modelo entiende la física, la iluminación y la intención emocional de tu escena
Haz clic para generar tu resultado final y descargar un vídeo de calidad profesional
Animación cinematográfica de la naturaleza con iluminación dinámica y movimiento ambiental —ideal para contenido de viajes o documentales de naturaleza.
Perfecta para anuncios de productos de alta gama, animando cristal, reflejos y movimiento de cámara para narrativas visuales de lujo.
Demuestra animación dramática del tiempo atmosférico y movimiento amplio de cámara, ideal para tráilers cinematográficos o intros atmosféricos.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
Pásate hoy a la síntesis guiada por razonamiento

Cinematic video from images fast
0.1 créditos

Animate images into video with audio
10 créditos

Animate image to 1080p video
2.8 créditos

Animate images into cinematic video
0.6 créditos

Cinematic video from images
10 créditos

Multimodal references to video
10 créditos