Video from image, audio references
O Grok Imagine Video 1.5 Reference to Video é um modelo image-to-video da xAI que transforma as suas imagens de referência e um prompt escrito em clipes de vídeo animados. Em vez de começar do zero, fornece ao modelo uma ou mais imagens de referência e descreve a cena que deseja, depois deixa-o gerar movimento que transporta o estilo e o conteúdo dessas referências para um vídeo finalizado.
O que distingue este modelo é a forma como utiliza as referências. Pode fornecer de uma a sete imagens de referência, e o modelo trata-as como guias tanto para o estilo como para o conteúdo. No seu prompt, pode referir imagens específicas usando tags simples como <IMAGE_0>, <IMAGE_1>, e assim sucessivamente. Isto permite escrever instruções como «A pessoa de <IMAGE_0> caminha por uma rua chuvosa iluminada por néon», para que o modelo saiba exatamente qual o sujeito ou elemento de estilo a extrair de cada imagem. Esse sistema de etiquetas dá-lhe um controlo criativo preciso sobre a forma como várias fontes visuais se combinam num único plano, o que é especialmente útil quando quer que uma personagem de uma imagem apareça num cenário ou estilo retirado de outras.
O modelo está concebido para trabalhos estilizados e transformadores e inclui capacidade de lip-sync, tornando-o ideal para dar vida a personagens e retratos com movimento expressivo e coordenado. Como aceita entradas de imagem, áudio e texto, pode sobrepor vários tipos de instruções ao mesmo tempo: imagens para definir o aspeto, texto para descrever a ação e áudio para guiar o tempo e o movimento da boca. A saída é sempre um ficheiro de vídeo, pronto para inserir na edição ou partilhar diretamente.
Os profissionais criativos encontrarão muita flexibilidade na forma como o clipe final é enquadrado e cronometrado. Pode escolher entre uma vasta gama de rácios de aspeto, incluindo widescreen 16:9 para visualização cinematográfica e de secretária, alto 9:16 para formatos sociais verticais como reels e stories, quadrado 1:1 para feeds, e várias opções intermédias como 4:3, 3:2, 2:3 e 3:4. Isto significa que pode gerar vídeo adaptado à plataforma ou layout exatos que tem em mente, sem necessidade de corte ou reformatação posterior. A duração do vídeo também é ajustável, desde um único segundo até quinze segundos, para criar um loop rápido, uma cena curta ou uma sequência mais longa consoante o seu projeto.
Para a qualidade de saída, o modelo oferece duas escolhas de resolução: 480p para clipes mais rápidos e leves e 720p para um resultado mais nítido e detalhado. As saídas de exemplo funcionam a 24 frames per second, dando ao movimento um ritmo suave e cinematográfico. Um clipe widescreen 720p sai com 1280 por 720 pixels, o que funciona bem na maioria dos contextos online e de pré-visualização.
Quem beneficia mais deste modelo? Artistas e ilustradores podem animar as suas obras de arte ou designs de personagens existentes, vendo uma peça estática mover-se e atuar. Designers podem transformar painéis de referência e imagens de humor em peças de conceito em movimento. Cineastas e criadores de vídeo podem prototipar planos combinando um sujeito com um ambiente descrito, gerando clipes rápidos de pré-visualização antes de se comprometerem com uma produção completa. Criadores de conteúdo que trabalham em várias plataformas sociais podem transformar imagens de referência em vídeos curtos e estilizados formatados precisamente para feeds verticais, quadrados ou widescreen. Como o lip-sync é suportado, qualquer pessoa que produza personagens falantes, avatares animados ou shorts narrados pode associar um retrato a áudio para criar clipes de desempenho sincronizados.
Os melhores resultados vêm de prompts bem pensados. Como o modelo lê tanto as suas imagens de referência como a sua descrição textual, descrever a ação claramente enquanto etiqueta as imagens certas ajuda-o a compreender exatamente o que deve mover e como. Quando utiliza várias referências, atribuir a cada uma um papel no seu prompt, como uma imagem para a personagem e outra para o ambiente ou estilo, mantém a composição coerente. Lembre-se de que pode combinar até sete imagens, o que lhe dá espaço para construir cenas ricamente estratificadas, mas um conjunto focado de referências com um prompt claro produz frequentemente os resultados mais limpos e controláveis.
Algumas considerações práticas valem a pena ter em mente. É necessária pelo menos uma imagem de referência e um prompt textual para cada geração, uma vez que o modelo está construído à volta da orientação da sua saída com referências visuais em vez de gerar apenas a partir de texto. A resolução máxima é 720p, pelo que este modelo visa vídeo estilizado, transformador e pronto para redes sociais em vez de acabamento em alta resolução e grande formato. A duração do clipe está limitada a quinze segundos, o que se adequa bem a narrativas curtas, loops e conteúdo social. Dentro desses limites, a combinação de referência multi-imagem, enquadramento flexível, duração ajustável e lip-sync torna-o uma ferramenta versátil para transformar imagens estáticas em movimento expressivo.
Em resumo, o Grok Imagine Video 1.5 Reference to Video é uma ferramenta de animação orientada por referências que dá aos criadores controlo direto sobre a forma como as suas imagens se tornam vídeo. Ao permitir etiquetar referências específicas dentro do seu prompt, escolher entre um vasto conjunto de rácios de aspeto, ajustar duração e resolução, e até sincronizar o movimento da boca com áudio, coloca as decisões criativas nas suas mãos enquanto trata da geração de movimento por si.
Add the image that you want change
Adicione uma imagem opcional para orientar o aspeto, a personagem ou o ambiente
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Escreva um prompt - O modelo compreende a física, a iluminação e a intenção emocional da sua cena
Clique para gerar o resultado final e transferir um vídeo de qualidade profissional
Demonstra paralaxe de referência multi-imagem enquanto a câmara desliza por uma porta com o primeiro plano a deslocar-se mais rápido que o fundo. Exibição arquitetónica cinematográfica 16:9.
Destaca física causal: a chuva começa a meio do clipe, as gotas criam ondulações em poças e escurecem o pavimento em sequência. Uma transformação atmosférica ampla cinematográfica.
Um cinemagraph amigável a loops perfeitos onde o vapor se enrosca e os reflexos de néon tremeluzem enquanto tudo o resto permanece congelado. Perfeito para ambiente de paisagem em loop infinito.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
Mude hoje para a síntese guiada por raciocínio

Animate images into video with audio
10 créditos

Animate images into 2K video
7.8 créditos
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 créditos

Multimodal references to video
10 créditos

Animate images into cinematic video
0.6 créditos

Cinematic video from images
10 créditos

Cinematic video from images fast
0.1 créditos

Animate image to 1080p video
2.8 créditos