Video from image, audio references
Grok Imagine Video 1.5 Reference to Video é um modelo de imagem para vídeo da xAI que transforma suas imagens de referência e um prompt escrito em clipes de vídeo animados. Em vez de começar do zero, você fornece ao modelo uma ou mais imagens de referência e descreve a cena desejada, então deixa que ele gere movimento que leva o estilo e o conteúdo dessas referências adiante para um vídeo finalizado.
O que diferencia este modelo é como ele usa as referências. Você pode fornecer de uma a sete imagens de referência, e o modelo as trata como guias tanto para estilo quanto para conteúdo. No seu prompt, você aponta para imagens específicas usando tags simples como <IMAGE_0>, <IMAGE_1> e assim por diante. Isso permite que você escreva instruções como "A pessoa de <IMAGE_0> caminha por uma rua chuvosa iluminada por neon", para que o modelo saiba exatamente qual sujeito ou elemento de estilo extrair de cada imagem. Esse sistema de tags dá a você controle criativo preciso sobre como múltiplas fontes visuais se combinam em um único take, o que é especialmente útil quando você quer que um personagem de uma imagem apareça dentro de um cenário ou estilo retirado de outras.
O modelo é projetado para trabalhos estilizados e transformadores e inclui capacidade de lip-sync, tornando-o ideal para dar vida a personagens e retratos com movimentos expressivos e coordenados. Como ele aceita entradas de imagem, áudio e texto, você pode sobrepor vários tipos de direção ao mesmo tempo: imagens para definir a aparência, texto para descrever a ação e áudio para guiar o timing e o movimento da boca. A saída é sempre um arquivo de vídeo, pronto para ser inserido na sua edição ou compartilhado diretamente.
Profissionais criativos encontrarão muita flexibilidade em como o clipe final é enquadrado e ritmado. Você pode escolher entre uma ampla gama de proporções, incluindo widescreen 16:9 para visualização cinematográfica e em desktop, alta 9:16 para formatos sociais verticais como reels e stories, quadrada 1:1 para feeds, e várias opções intermediárias como 4:3, 3:2, 2:3 e 3:4. Isso significa que você pode gerar vídeos adaptados exatamente à plataforma ou layout que tem em mente, sem precisar cortar ou reformataar depois. O comprimento do vídeo também é ajustável, variando de um único segundo até quinze segundos, para que você possa criar um loop rápido, uma cena curta ou uma sequência mais longa dependendo do seu projeto.
Para a qualidade de saída, o modelo oferece duas opções de resolução: 480p para clipes mais rápidos e leves e 720p para um resultado mais nítido e com maior detalhe. Exemplos de saídas rodam a 24 frames per second, dando ao movimento um ritmo suave e cinematográfico. Um clipe widescreen 720p sai em 1280 por 720 pixels, o que funciona bem para a maioria dos contextos online e de pré-visualização.
Quem se beneficia mais deste modelo? Artistas e ilustradores podem animar suas obras de arte ou designs de personagens existentes, vendo uma peça estática ganhar movimento e performar. Designers podem transformar painéis de referência e imagens de mood em peças de conceito em movimento. Cineastas e criadores de vídeo podem prototipar takes combinando um sujeito com um ambiente descrito, gerando clipes rápidos de previsualização antes de se comprometer com uma produção completa. Criadores de conteúdo que trabalham em várias plataformas sociais podem transformar imagens de referência em vídeos curtos e estilizados, formatados precisamente para feeds verticais, quadrados ou widescreen. Como o lip-sync é suportado, qualquer um que produza personagens falantes, avatares animados ou curtas narrados pode combinar um retrato com áudio para criar clipes de performance sincronizados.
Os melhores resultados vêm de prompts bem pensados. Como o modelo lê tanto suas imagens de referência quanto a descrição de texto, descrever a ação claramente enquanto marca as imagens certas ajuda-o a entender exatamente o que deve se mover e como. Quando você usa múltiplas referências, atribuindo a cada uma um papel no seu prompt, como uma imagem para o personagem e outra para o ambiente ou estilo, mantém a composição coerente. Lembre-se de que você pode combinar até sete imagens, o que dá espaço para construir cenas ricamente estratificadas, mas um conjunto focado de referências com um prompt claro geralmente produz os resultados mais limpos e controláveis.
Algumas considerações práticas valem a pena ser lembradas. Pelo menos uma imagem de referência e um prompt de texto são obrigatórios para cada geração, já que o modelo é construído em torno de guiar sua saída com referências visuais em vez de gerar apenas a partir de texto. A resolução máxima é 720p, então este modelo é voltado para vídeos estilizados, transformadores e prontos para redes sociais, em vez de acabamento em alta resolução e grande formato. O comprimento do clipe é limitado a quinze segundos, o que se adequa bem a narrativas curtas, loops e conteúdo social. Dentro desses limites, a combinação de referenciação multi-imagem, enquadramento flexível, duração ajustável e lip-sync faz dele uma ferramenta versátil para transformar imagens estáticas em movimento expressivo.
Em resumo, Grok Imagine Video 1.5 Reference to Video é uma ferramenta de animação guiada por referências que dá aos criadores controle direto sobre como suas imagens se tornam vídeo. Ao permitir que você marque referências específicas dentro do seu prompt, escolha entre um amplo conjunto de proporções, ajuste comprimento e resolução, e até sincronize o movimento da boca com áudio, ele coloca as decisões criativas em suas mãos enquanto cuida da geração de movimento por você.
Add the image that you want change
Adicione uma imagem opcional para orientar o visual, o personagem ou o ambiente
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Digite um prompt - o modelo compreende a física, a iluminação e a intenção emocional da sua cena
Clique para gerar o resultado final e baixe um vídeo com qualidade de produção
Demonstra paralaxe de referência multi-imagem enquanto a câmera desliza por uma porta com o primeiro plano se movendo mais rápido que o fundo. Exibição arquitetônica cinematográfica 16:9.
Destaca física causal: chuva começa no meio do clipe, gotas criam ondulações em poças e escurecem o pavimento em sequência. Uma transformação atmosférica ampla cinematográfica.
Um cinemagráfico amigável a loops contínuos onde vapor se enrosca e reflexos de neon cintilam enquanto tudo o mais fica congelado. Perfeito para ambientação de paisagem em loop infinito.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
Mude para a síntese guiada por raciocínio hoje mesmo
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 créditos

Animate image to 1080p video
2.8 créditos

Animate images into cinematic video
0.6 créditos

Multimodal references to video
10 créditos

Cinematic video from images
10 créditos

Animate images into 2K video
7.8 créditos

Cinematic video from images fast
0.1 créditos

Animate images into video with audio
10 créditos