Cinematic video from references
Seedance 2.0 Fast Reference to Video é o modelo de vídeo de referência mais avançado da ByteDance, oferecido numa versão rápida, afinado para resultados mais céleres sem sacrificar a criatividade. Em vez de gerar um vídeo apenas a partir de um prompt de texto, permite-lhe fornecer materiais de referência próprios e coreografar como esses elementos aparecem no ecrã. Pode combinar até nove imagens de referência, três vídeos de referência e três excertos áudio numa única geração, misturando e combinando fontes visuais e sonoras para orientar o aspeto, movimento e som do vídeo final.
O que distingue este modelo é a forma direta como pode apontar para as suas referências no prompt. Cada imagem, vídeo e ficheiro áudio que faz upload recebe uma referência simples, para poder escrever, por exemplo, @Image1, @Video2 ou @Audio1 na descrição e indicar ao modelo exatamente qual a fonte que deve influenciar cada momento ou elemento. Ou seja, não está apenas a esperar que o modelo entenda o ambiente — pode dar nomes à personagem de uma imagem, ao estilo de movimento de um vídeo e à voz ou ambiente de uma faixa áudio, descrevendo depois como interagem. É um fluxo de trabalho ideal para transformar e estilizar materiais existentes, garantir a continuidade visual entre cenas e sincronizar os lábios com áudio fornecido.
O modelo gera vídeo finalizado com áudio sincronizado. Quando ativa a geração de áudio, produz efeitos sonoros, ruídos ambientes e fala sincronizada com o movimento em ecrã, garantindo que a boca acompanha as palavras. Se preferir usar a sua própria banda sonora ou voz, pode fornecer faixas de áudio de referência e mencioná-las no seu prompt. Note que sempre que incluir áudio de referência, tem também de adicionar pelo menos uma imagem ou vídeo de referência, para o modelo poder ancorar o som a algo visual.
A flexibilidade de enquadramento é total. Pode escolher entre vários formatos, incluindo widescreen 16:9 para paisagem, 9:16 para vertical e conteúdos mobile, 1:1 quadrado para redes sociais, ultrawide 21:9 para cenas cinematográficas, além de opções 4:3 e 3:4 — ou então deixar o modelo escolher automaticamente de acordo com o seu prompt. Em relação à duração, também é flexível: pode criar vídeos de 4 a 15 segundos ou deixar o modelo decidir automaticamente em função da história que descreveu. Esta variedade torna simples criar desde um curto loop para redes sociais até uma sequência narrativa mais longa.
Quanto à qualidade de saída, pode optar por 480p para uma geração mais rápida ou 720p para um resultado equilibrado. Existe igualmente um controlo de qualidade que permite solicitar uma versão de maior qualidade e ficheiro maior caso queira o vídeo no melhor acabamento possível, ou manter o ficheiro em tamanho reduzido e normal para iterações rápidas. Estes ajustes permitem-lhe gerir a velocidade e o tamanho dos ficheiros em função do seu objetivo — seja uma rápida experimentação ou exportação final.
Os inputs suportados são vastos e práticos. As imagens de referência podem ser JPEG, PNG ou WebP. Os vídeos de referência podem ser MP4 ou MOV, cada um entre 480p e 720p de resolução, com o tempo total entre 2 e 15 segundos. Os ficheiros áudio podem ser MP3 ou WAV, totalizando no máximo 15 segundos entre todos os excertos. No total, pode incluir até doze ficheiros de referência por geração, proporcionando uma paleta rica e flexível para trabalhar enquanto mantém o processo controlado.
Este modelo é ideal para um vasto conjunto de profissionais criativos. Realizadores e editores podem usá-lo para estilizar e transformar imagens, prolongar cenas ou fundir várias gravações numa só tomada contínua. Criadores de conteúdos e produtores para redes sociais beneficiam dos formatos verticais e quadrados e das durações curtas, pensadas para feeds. Designers de personagens e animadores podem recorrer ao sistema de referências para manter o aspeto consistente entre cenas ou criar lip-sync a partir de voz fornecida. Músicos e contadores de histórias áudio podem emparelhar uma faixa com imagens, deixando o modelo alinhar o movimento ao som. Como pode nomear as fontes nas instruções, o modelo recompensa a direção clara e descritiva: quanto mais explicitar que referência faz o quê e como a cena deve decorrer, maior controlo terá sobre o resultado.
Há alguns aspetos práticos a ter em conta. O áudio de referência exige sempre pelo menos uma imagem ou vídeo de referência em simultâneo. Os vídeos de referência têm de respeitar as janelas suportadas de resolução e duração, e o áudio total não pode exceder quinze segundos. O número global de ficheiros de referência é doze — planifique bem as fontes essenciais para a sua cena. Resoluções e qualidade superiores geram ficheiros maiores e visuais melhores, mas demoram mais tempo a processar; em 480p e no modo normal obtém uma resposta mais rápida. Tal como acontece com qualquer geração baseada em referências, melhores resultados são obtidos com materiais nítidos, bem iluminados e enquadrados, e prompts que nomeiem explicitamente cada referência e descrevam o movimento, ambiente e som pretendidos. Usado assim, Seedance 2.0 Fast Reference to Video é uma ferramenta flexível para transformar as suas próprias imagens, vídeos e áudio em filmes curtos e sincronizados ao som sob a sua direção.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descreva a cena do seu vídeo com movimento, ângulos de câmara e ambiente
O modelo cria movimento cinematográfico com física e iluminação naturais
Transfira e partilhe o seu vídeo pronto para produção
Demonstra a simulação de física real e dinâmicas atmosféricas do modelo — criando sistemas meteorológicos críveis, movimentos animais e transformações ambientais dramáticas com linguagem cinematográfica digna da Netflix e áudio nativo.
Revela a precisão do Seedance 2.0 na física de objetos, dinâmica de líquidos, detalhes macro e transições estilizadas fluidas — ideal para publicidade de produtos de luxo com foley sincronizado e ambiente sonoro envolvente.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Mude hoje para a síntese guiada por raciocínio

Text to video with audio
0.3 créditos
Text to video with audio
0.7 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Cinematic video with native audio
1.4 créditos

Frontier 2K text-to-video generation
7.3 créditos

Fast cinematic video with audio
0.1 créditos

Cinematic video from references
10 créditos

Fast balanced text-to-video generation
1.6 créditos

Film-grade video with audio
0.1 créditos