Cinematic video from references
Seedance 2 Reference to Video é o modelo de vídeo impulsionado por referências mais avançado da ByteDance, criado para criadores que desejam direcionar a geração com material de origem real em vez de apenas texto. Em vez de descrever tudo do zero, você fornece ao modelo uma mistura de arquivos de referência, até 9 imagens, 3 vídeos e 3 clipes de áudio (com um total de 12 arquivos em todos os tipos), e os entrelaça com um prompt escrito. Você aponta para cada ativo diretamente no seu prompt usando tags simples como @Image1, @Video1 ou @Audio1, para que o modelo saiba exatamente qual rosto, ambiente, movimento ou som você quer que ele respeite. O resultado é um único clipe cinematográfico contínuo que respeita suas referências enquanto preenche o mundo ao redor delas.
O recurso principal é o áudio nativo. Em uma única passada de geração, o modelo produz som sincronizado junto com a imagem: ruído ambiente, efeitos sonoros, música e até diálogo sincronizado com os lábios. Não há uma etapa separada para adicionar som depois. Isso significa que uma cena de multidão agitada pode chegar com gritos sobrepostos, cliques de obturador da câmera, sirenes distantes e motor em marcha lenta já incorporados e cronometrados com a ação na tela. Você pode deixar a geração de áudio ligada para obter um clipe totalmente finalizado, ou desligá-la se preferir gerenciar o som sozinho.
O controle criativo é uma grande força. Você direciona a câmera por meio do seu prompt usando linguagem cinematográfica, solicitando dolly zooms, planos de rastreamento, movimento handheld com micro-tremores naturais, trocas de POV e perspectivas no nível dos olhos ou elevadas. O modelo interpreta essas direções como um diretor de fotografia faria. Ele também lida com física realista, então dinâmicas de fluidos, movimento de tecidos e movimentos de personagens se comportam de forma crível. Uma capacidade especialmente útil é a edição multi-shot: em uma única geração de até 15 segundos, o modelo pode criar cortes naturais, dando sequências que fluem entre planos em vez de um único quadro fixo.
Como aceita referências de imagem, o modelo se destaca na consistência. Forneça uma referência de personagem e ele pode renderizar o mesmo rosto e roupa em todo o plano, mesmo ao traduzir o sujeito para um estilo visual diferente. Exemplos mostram um visual híbrido onde personagens animados 3D estilizados são compostos perfeitamente em um ambiente live-action totalmente fotorrealista, com o personagem referenciado mantendo um rosto perfeitamente consistente e a roupa exata da imagem de origem, tudo enquanto interage de forma crível com luz real, reflexos de flash, realces de postes de rua e sombras projetadas. Isso o torna uma escolha forte para qualquer um que precise de um personagem recorrente, um produto específico ou um visual fixo que permaneça confiável em uma cena.
Nas opções de saída, você pode gerar em 480p para processamento mais rápido, 720p para um equilíbrio de velocidade e qualidade, ou 1080p para resultados de alta qualidade. A duração é flexível de 4 a 15 segundos, ou você pode deixar o modelo decidir automaticamente com base no seu prompt. A proporção de aspecto é igualmente adaptável: escolha 16:9 para paisagem, 9:16 para formatos verticais e sociais, 1:1 para quadrado, 21:9 para enquadramento cinematográfico ultrawide, 4:3, 3:4 ou auto para o modelo escolher. Você também pode solicitar uma codificação de maior qualidade quando quiser um arquivo maior e mais limpo, e fixar um valor de seed para reproduzir um resultado que gostou, embora variações menores ainda possam ocorrer.
As entradas de referência têm limites sensatos que vale a pena conhecer. Imagens podem ser JPEG, PNG ou WebP de até 30 MB cada, com até 9 permitidas. Vídeos podem ser MP4 ou MOV, com duração combinada entre 2 e 15 segundos, total abaixo de 50 MB e cada vídeo entre 480p e 720p de resolução, com até 3 permitidos. Áudio pode ser MP3 ou WAV, até 3 clipes com duração combinada de no máximo 15 segundos e máximo de 15 MB cada. Uma regra importante: se você fornecer referências de áudio, deve incluir pelo menos uma referência de imagem ou vídeo. E independentemente de como misturá-los, o número total de arquivos de referência em todas as modalidades não pode exceder 12.
Quem se beneficia? Cineastas e diretores de vídeo têm uma forma de pré-visualizar ou produzir sequências cinematográficas curtas com linguagem real de câmera e som finalizado. Criadores de conteúdo e produtores de redes sociais podem transformar uma única referência de personagem em clipes verticais consistentes. Anunciantes e profissionais de marketing de produtos podem inserir uma imagem de produto em um ambiente estilizado e iluminado com um movimento de câmera controlado. Animadores e artistas de mídias mistas podem misturar personagens estilizados em mundos fotorrealistas, exatamente o fluxo de trabalho híbrido destacado nos exemplos. Como usa suas próprias imagens, vídeos e áudio, é ideal sempre que consistência de marca, identidade de personagem ou um visual específico importam mais do que adivinhação pura de texto para vídeo.
Algumas melhores práticas surgem naturalmente de como funciona. Escreva prompts como um diretor: descreva o estilo, a iluminação e o ambiente, o sujeito, a sequência de ações e o áudio desejado, e referencie seus ativos explicitamente com tags @ para que o modelo saiba o que preservar. Mantenha suas referências de vídeo dentro dos limites de duração e resolução para uso limpo, e lembre-se de que fornecer áudio exige pelo menos uma referência visual para ancorá-lo. Para os resultados mais polidos, invista em descrições detalhadas de ações e direções de câmera, já que o modelo responde bem a esse nível de especificidade, como visto no exemplo elaborado de multidão e comboio. Com referências pensadas e direção clara, Seedance 2 Reference to Video entrega clipes cinematográficos finalizados e completos com som que permanecem fiéis ao material que você traz.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descreva a cena do seu vídeo com movimento, ângulos de câmera e clima
O modelo cria movimento cinematográfico com física e iluminação naturais
Baixe e compartilhe seu vídeo pronto para produção
Destaca o controle de câmera nivel diretor do Seedance 2 com movimentos de câmera multi-etapa complexos, simulação de clima atmosférico e dinâmicas de cena em escala de paisagem adequadas para cinematografia de viagem widescreen.
Demonstra a capacidade do Seedance 2 de lidar com transições de cena complexas, física estilizada (vidro estilhaçando, detritos flutuando) e coreografia dramática de iluminação — exibindo a capacidade narrativa de cut-scene para produção de videoclipes.
Destaca o motor de física do mundo real do Seedance 2 e geração de áudio nativa com design sonoro ambiental (neve rangendo, vento, respiração) — demonstrando imagens de documentário de natureza no nível Netflix com movimento preciso de animais e dinâmicas atmosféricas.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Mude para a síntese guiada por raciocínio hoje mesmo
Text to video with audio
0.7 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Fast balanced text-to-video generation
1.6 créditos

Cinematic video from references
0.4 créditos

Film-grade video with audio
0.1 créditos

Fast cinematic video with audio
0.1 créditos

Text to video with audio
0.3 créditos

Cinematic video with native audio
1.4 créditos

Frontier 2K text-to-video generation
7.3 créditos