Cinematic video from references
O Seedance 2 Reference to Video é o modelo de vídeo impulsionado por referências mais avançado da ByteDance, construído para criadores que querem direcionar a geração com material de origem real em vez de apenas texto. Em vez de descrever tudo do zero, você fornece ao modelo uma mistura de ficheiros de referência, até 9 imagens, 3 vídeos e 3 clipes de áudio (com um total de 12 ficheiros de todos os tipos), e entrelaça-os com um prompt escrito. Você aponta para cada ativo diretamente no seu prompt usando tags simples como @Image1, @Video1 ou @Audio1, para que o modelo saiba exatamente qual rosto, ambiente, movimento ou som você quer que respeite. O resultado é um clipe cinematográfico contínuo único que respeita as suas referências enquanto preenche o mundo à volta delas.
A funcionalidade destacada é o áudio nativo. Num único passo de geração, o modelo produz som sincronizado juntamente com a imagem: ruído ambiente, efeitos sonoros, música e até diálogo sincronizado com os lábios. Não há um passo separado para adicionar som mais tarde. Isso significa que uma cena de multidão agitada pode chegar com gritos sobrepostos, cliques do obturador da câmara, sirenes distantes e um motor ao ralenti já incorporados e cronometrados com a ação no ecrã. Pode deixar a geração de áudio ligada para obter um clipe totalmente acabado, ou desligá-la se preferir tratar do som você mesmo.
O controlo criativo é uma grande força. Você dirige a câmara através do seu prompt usando linguagem cinematográfica, pedindo dolly zooms, planos de seguimento, movimento manual com micro-vibração natural, mudanças de POV e perspetivas ao nível dos olhos ou elevadas. O modelo interpreta estas direções como um diretor de fotografia faria. Também gere física realista, pelo que dinâmicas de fluidos, movimento de tecidos e movimento de personagens se comportam de forma credível. Uma capacidade especialmente útil é a edição multi-plano: numa única geração de até 15 segundos, o modelo pode criar cortes naturais, dando-lhe sequências que fluem entre planos em vez de um único plano fixo.
Como aceita referências de imagem, o modelo destaca-se na consistência. Forneça uma referência de personagem e ele pode renderizar o mesmo rosto e roupa ao longo do plano, mesmo ao traduzir o sujeito para um estilo visual diferente. Exemplos mostram um aspeto híbrido onde personagens animadas 3D estilizadas são compostas de forma perfeita num ambiente live-action totalmente fotorrealista, com a personagem referenciada a manter um rosto perfeitamente consistente e a roupa exata da imagem de origem, tudo enquanto interage de forma credível com luz real, rebound de flashes, realces de luzes de rua e sombras projetadas. Isto torna-o uma escolha forte para quem precisa de uma personagem recorrente, um produto específico ou um aspeto fixo para manter fiabilidade ao longo de uma cena.
Nas opções de saída, pode gerar em 480p para um turnaround mais rápido, 720p para um equilíbrio entre velocidade e qualidade, ou 1080p para resultados de alta qualidade. A duração é flexível de 4 a 15 segundos, ou pode deixar o modelo decidir automaticamente com base no seu prompt. A proporção de aspeto é igualmente adaptável: escolha 16:9 para paisagem, 9:16 para formatos verticais e sociais, 1:1 para quadrado, 21:9 para enquadramento cinematográfico ultralargo, 4:3, 3:4 ou auto para deixar o modelo escolher. Também pode pedir uma codificação de qualidade superior quando quiser um ficheiro maior e mais limpo, e fixar um valor de seed para reproduzir um resultado que gostou, embora possa ocorrer alguma variação menor.
As entradas de referência têm limites sensatos que vale a pena conhecer. As imagens podem ser JPEG, PNG ou WebP até 30 MB cada, com até 9 permitidas. Os vídeos podem ser MP4 ou MOV, com uma duração combinada entre 2 e 15 segundos, um total inferior a 50 MB e cada vídeo entre 480p e 720p de resolução, com até 3 permitidos. O áudio pode ser MP3 ou WAV, até 3 clipes com uma duração combinada de no máximo 15 segundos e um máximo de 15 MB cada. Uma regra importante: se fornecer referências de áudio, deve também incluir pelo menos uma referência de imagem ou vídeo. E independentemente de como os misturar, o número total de ficheiros de referência de todas as modalidades não pode exceder 12.
Quem beneficia? Realizadores e diretores de vídeo obtêm uma forma de prever ou produzir sequências cinematográficas curtas com linguagem de câmara real e som acabado. Criadores de conteúdo e produtores de redes sociais podem transformar uma única referência de personagem em clipes verticais consistentes. Anunciantes e marketeers de produtos podem inserir uma imagem de produto num ambiente estilizado e iluminado com um movimento de câmara controlado. Animadores e artistas de média mista podem misturar personagens estilizadas em mundos fotorrealistas, exatamente o fluxo de trabalho híbrido destacado nos exemplos. Como recorre às suas próprias imagens, vídeos e áudio, é ideal sempre que a consistência de marca, identidade de personagem ou um aspeto específico importa mais do que adivinhação pura de texto para vídeo.
Algumas melhores práticas surgem naturalmente da forma como funciona. Escreva prompts como um realizador: descreva o estilo, a iluminação e ambiente, o sujeito, a sequência de ação e o áudio que quer, e referencie os seus ativos explicitamente com tags @ para que o modelo saiba o que preservar. Mantenha as suas referências de vídeo dentro dos limites de duração e resolução para que possam ser usadas de forma limpa, e lembre-se de que fornecer áudio requer pelo menos uma referência visual para o ancorar. Para os resultados mais polidos, aposte em descrições detalhadas de ação e direções de câmara, uma vez que o modelo responde bem a esse nível de especificidade, como visto no exemplo elaborado de multidão e comboio. Com referências pensadas e direção clara, o Seedance 2 Reference to Video entrega clipes cinematográficos acabados e completos com som que permanecem fiéis ao material que lhe traz.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descreva a cena do seu vídeo com movimento, ângulos de câmara e ambiente
O modelo cria movimento cinematográfico com física e iluminação naturais
Transfira e partilhe o seu vídeo pronto para produção
Destaca o controlo de câmara ao nível de realizador do Seedance 2 com movimentos de câmara multi-etapa complexos, simulação atmosférica de tempo e dinâmicas de cena em escala de paisagem adequadas para cinematografia de viagem em ecrã largo.
Demonstra a capacidade do Seedance 2 para gerir transições de cena complexas, física estilizada (vidro estilhaçado, detritos flutuantes) e coreografia dramática de iluminação — mostrando a capacidade narrativa de cut-scene para produção de vídeos musicais.
Mostra o motor de física do mundo real do Seedance 2 e geração de áudio nativa com design sonoro ambiental (neve estaladiça, vento, respiração) — demonstrando imagens de documentário de natureza de qualidade Netflix com movimento preciso de animais e dinâmicas atmosféricas.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Mude hoje para a síntese guiada por raciocínio

Cinematic video with native audio
1.4 créditos
Text to video with audio
0.7 créditos

Fast balanced text-to-video generation
1.6 créditos

Frontier 2K text-to-video generation
7.3 créditos

Cinematic video from references
0.4 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Text to video with audio
0.3 créditos

Fast cinematic video with audio
0.1 créditos

Film-grade video with audio
0.1 créditos