Cinematic video from references
Seedance 2.0 Fast Reference to Video é o modelo de vídeo dirigido por referências mais avançado da ByteDance, entregue em um nível rápido ajustado para resultados mais rápidos sem sacrificar a gama criativa. Em vez de gerar um vídeo apenas a partir de um prompt de texto, ele permite que você forneça seu próprio material de referência ao modelo e depois coreografe como esses elementos se combinam na tela. Você pode combinar até nove imagens de referência, até três vídeos de referência e até três clipes de áudio em uma única geração, misturando e combinando fontes visuais e sonoras para direcionar a aparência, o movimento e o som do clipe final.
O que diferencia este modelo é o quão diretamente você pode apontar para suas referências dentro do seu prompt. Cada imagem, vídeo e arquivo de áudio que você carrega recebe um identificador simples, então você escreve coisas como @Image1, @Video2 ou @Audio1 diretamente na sua descrição para dizer ao modelo exatamente qual fonte deve influenciar qual momento ou sujeito. Isso significa que você não está apenas esperando que o modelo capte um humor, você está nomeando o personagem de uma imagem, o estilo de movimento de um clipe e a voz ou ambiente de uma faixa de áudio, depois descrevendo como eles interagem. É um fluxo de trabalho construído para transformar e estilizar material existente, carregar personagens e aparências entre tomadas e sincronizar lábios de performances com áudio fornecido.
O modelo gera vídeo finalizado com áudio sincronizado. Quando a geração de áudio está ativada, ele produz efeitos sonoros, ruído ambiente e fala sincronizada com os lábios que combinam com a ação na tela, para que um sujeito falante mova a boca no tempo com as palavras. Se você preferir fornecer sua própria trilha sonora ou voz, pode fornecer clipes de áudio de referência e referenciá-los no seu prompt. Note que sempre que incluir áudio de referência, você também precisa de pelo menos uma imagem ou vídeo de referência para que o modelo tenha algo visual para ancorar o som.
Você tem controle flexível sobre o enquadramento. Escolha entre um conjunto completo de proporções, incluindo 16:9 widescreen para paisagem, 9:16 para conteúdo vertical e otimizado para mobile, 1:1 quadrado para feeds sociais, ultrawide 21:9 para sequências cinematográficas, além de opções 4:3 e 3:4, ou deixe o modelo decidir automaticamente com base no seu prompt. A duração é igualmente adaptável: gere clipes de 4 a 15 segundos, ou defina como automático para que o comprimento se ajuste à história que você descreveu. Essa faixa facilita a produção de tudo, desde um clipe social rápido em loop até um trecho narrativo mais longo.
Para a qualidade de saída, você pode escolher entre 480p para geração mais rápida e 720p para um resultado equilibrado. Há também um controle de qualidade que permite solicitar uma versão de maior qualidade e arquivo maior quando você quiser a filmagem mais limpa possível, ou ficar com a versão padrão para arquivos menores. Essas configurações permitem trocar velocidade e tamanho de arquivo por fidelidade, dependendo se você está iterando rapidamente em ideias ou exportando uma peça final.
As entradas suportadas são amplas e práticas. Imagens de referência podem ser JPEG, PNG ou WebP. Vídeos de referência podem ser MP4 ou MOV, e cada um deve ter resolução aproximadamente entre 480p e 720p, com o comprimento combinado dos seus clipes entre 2 e 15 segundos. Áudio de referência pode ser MP3 ou WAV, com o áudio total não excedendo 15 segundos em todos os clipes. Em todos os tipos de arquivo combinados, você pode incluir até doze itens de referência em uma única geração, dando uma paleta rica para extrair enquanto mantém as coisas gerenciáveis para o modelo.
Este modelo é ideal para uma ampla gama de profissionais criativos. Cineastas e editores de vídeo podem usá-lo para estilizar e transformar filmagens, estender uma cena ou misturar múltiplas tomadas em uma única tomada coesa. Criadores de conteúdo e produtores de redes sociais se beneficiam das opções de enquadramento vertical e quadrado e durações curtas e impactantes feitas para feeds. Designers de personagens e animadores podem contar com o sistema de referência para manter um sujeito reconhecível em um clipe e direcionar sincronização labial a partir de uma voz fornecida. Músicos e contadores de histórias de áudio podem parear uma faixa com visuais e deixar o modelo alinhar o movimento ao som. Como você pode referenciar fontes específicas pelo nome no prompt, o modelo recompensa direção deliberada e descritiva: quanto mais claramente você especificar qual referência faz o quê e como a cena deve se desenrolar, mais controle você obtém sobre o resultado.
Algumas considerações práticas valem a pena lembrar. Áudio de referência sempre precisa de pelo menos uma imagem ou vídeo de referência ao lado. Seus vídeos de referência precisam estar dentro das janelas de resolução e comprimento suportadas, e o áudio combinado total deve ficar dentro de quinze segundos. O número total de referências em imagens, vídeos e áudio chega a no máximo doze arquivos, então planeje quais fontes importam mais para sua tomada. Resolução mais alta e qualidade mais alta produzem arquivos maiores e de melhor aparência, mas levam mais tempo para renderizar, enquanto 480p e a versão padrão são ideais para iteração rápida. Como em qualquer geração baseada em referência, os resultados melhoram quando seu material de origem é limpo, bem iluminado e claramente enquadrado, e quando seu prompt nomeia cada referência explicitamente e descreve o movimento, humor e som que você quer. Usado dessa forma, Seedance 2.0 Fast Reference to Video se torna uma ferramenta flexível para transformar suas próprias imagens, clipes e áudio em vídeos curtos sincronizados com som e uma aparência que você dirige.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descreva a cena do seu vídeo com movimento, ângulos de câmera e clima
O modelo cria movimento cinematográfico com física e iluminação naturais
Baixe e compartilhe seu vídeo pronto para produção
Demonstra a simulação de física do mundo real e dinâmicas atmosféricas do modelo — renderizando sistemas climáticos críveis, movimento animal e transformações ambientais dramáticas com linguagem cinematográfica de qualidade Netflix e áudio nativo.
Mostra a precisão do Seedance 2.0 com física de objetos, dinâmicas de líquidos, detalhes em nível macro e transições estilizadas perfeitas — ideal para cinematografia de produtos de luxo com foley sincronizado e áudio atmosférico.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Mude para a síntese guiada por raciocínio hoje mesmo

Cinematic video with native audio
1.4 créditos
Text to video with audio
0.7 créditos
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 créditos

Fast balanced text-to-video generation
1.6 créditos

Cinematic video from references
10 créditos

Film-grade video with audio
0.1 créditos

Frontier 2K text-to-video generation
7.3 créditos

Text to video with audio
0.3 créditos

Fast cinematic video with audio
0.1 créditos