Como criar vídeos com IA a partir de múltiplas imagens de referência
Nove imagens, uma geração. Veja exatamente como usar o modo de referência com múltiplas imagens no Seedance 2.0 para obter vídeos de IA que realmente correspondem à sua intenção visual.

A maioria dos modelos de vídeo com IA aceita uma imagem. O Seedance 2.0 Reference aceita nove. Essa não é uma diferença pequena: é a diferença entre "começar a partir de um fotograma" e "herdar uma linguagem visual completa."
Este tutorial cobre o fluxo de trabalho com múltiplas imagens: quantas referências usar, quais escolher, como elas se fundem e como resolver problemas quando o resultado não corresponde ao esperado.
Resumo rápido
- O Seedance 2.0 Reference aceita até 9 imagens por geração
- Mais imagens nem sempre é melhor: 4-6 referências coesas costumam superar 9 soltas
- Todas as 9 são fundidas em um único "vetor de estilo" que o modelo aplica ao resultado
- O custo é $0,3024/seg independentemente de quantas referências você enviar
- Experimente a geração de múltiplas imagens gratuitamente
O que acontece quando você envia 9 imagens
O modelo não trata suas 9 imagens como quadros separados. Ele as funde em uma única representação de estilo, um resumo matemático dos atributos visuais compartilhados. Esse resumo orienta o resultado.
Se suas 9 imagens compartilham atributos (luz quente, profundidade de campo rasa, paleta semelhante), o vetor fundido é forte e específico. O resultado se prende a esse estilo.
Se suas 9 imagens divergem (algumas quentes, algumas frias, algumas abertas, algumas fechadas), o vetor fundido se aproxima do genérico e o estilo mal aparece.
A curadoria importa mais do que a quantidade.
5 gerações gratuitas · Nenhum cartão de crédito necessário
Quantas referências usar de verdade
| Número | Quando usar |
|---|---|
| 1-2 | Quadro principal único, transferência de estilo mínima |
| 3-4 | Estilo claro com variação mínima |
| 5-6 | Ponto ideal para a maioria dos projetos |
| 7-9 | Estilo complexo com múltiplas facetas |
A faixa de 5-6 é onde a maioria dos usuários experientes chega. É variedade suficiente para capturar as diferentes expressões de um estilo sem diluir o sinal com contradições.
Use mais apenas quando você realmente tiver mais facetas a capturar, por exemplo, imagens internas e externas no mesmo estilo cinematográfico. Caso contrário, 5-6 imagens coesas sempre superarão 9 imagens soltas.
A estrutura de seleção de referências
Ao escolher referências, cubra estas dimensões:
Paleta de cores. 1-2 imagens que mostrem claramente o seu color grading alvo.
Direção da luz. 1-2 imagens mostrando de onde a luz vem (dura/suave, alta/baixa, quente/fria).
Composição e enquadramento. 1-2 imagens mostrando sua construção de plano preferida (simétrica, regra dos terços, fechada/aberta).
Textura e grão. 1 imagem que capture a sensação de detalhe fino (grão de filme, limpo digital, padrão de ruído).
Tratamento do sujeito. 1-2 imagens mostrando como os sujeitos costumam ser tratados (isolados, misturados, em silhueta).
Se você cobrir cada dimensão, chegará naturalmente a 5-7 imagens. Esse é o alvo.

Monte seu primeiro conjunto de múltiplas imagens. Escolha 5-6 imagens que concordem no estilo e teste. Comece grátis com 10 créditos.
Um exemplo com curadoria
Suponha que você queira o visual dos filmes de Denis Villeneuve: empoeirado, desbotado, de escala épica e temperaturas de cor específicas.
Meu conjunto:
- Plano aberto do deserto de Duna (escala e paleta)
- Close-up de um personagem em luz de poeira quente (temperatura de cor)
- Plano interno de Blade Runner 2049 (paleta desbotada, enquadramento)
- Plano de neblina de Arrival (atmosfera e luz suave)
- Cena noturna de Sicario (viés azul frio, enquadramento de tensão)
- Um quadro principal mostrando exatamente o clima que estou buscando
Seis imagens. Todas concordam com a estética de Villeneuve. O resultado vai pender fortemente para esse visual independentemente do que eu coloque no prompt.
Combinando múltiplas imagens com prompts
Lembre-se: as referências cuidam do estilo. Os prompts cuidam do sujeito e da ação.
Com 6 referências de estilo fortes, seu prompt deve ser puramente descritivo do que acontece:
Uma figura com capa encapuzada caminha por uma vasta planície de sal ao pôr do sol,
o vento agitando o tecido, plano de travelling aberto, 8 segundos
Não há nenhuma linguagem de estilo. Sem "cinemático", sem "épico", sem "atmosférico". As referências já estão dizendo tudo isso mais alto do que as palavras poderiam.
Quando as referências brigam entre si
O problema mais comum com múltiplas imagens é a contradição. Sinais de que suas referências estão em conflito:
- O color grading do resultado fica turvo ou mediano
- A iluminação parece genérica em vez de específica
- O estilo parece "gerado por IA" apesar das referências
- Dois clipes com as mesmas referências produzem visuais visivelmente diferentes
Solução: remova as 1-2 imagens discrepantes. Teste novamente. Se o problema persistir, você provavelmente tem 2 ou mais grupos de estilo incompatíveis e precisa se comprometer com apenas um.
O processo de depuração: gere um clipe de teste com todas as 9 imagens. Em seguida, gere novamente com metade das imagens removidas. Compare. A versão com menos referências quase sempre parecerá mais decisiva.
Experimente o Seedance 2.0 Reference: geração de vídeo multimodal
9 imagens, 1 estilo fundido, 1 vídeo definido. Créditos gratuitos, sem necessidade de cartão.
Experimente o Seedance 2.0 Reference gratuitamenteO conceito do quadro principal
Entre suas referências, designe um "quadro principal": a imagem única que melhor captura exatamente o clima que você deseja. O modelo ainda funde todas as referências igualmente, mas o quadro principal é o seu norte verdadeiro. Se o resultado se afastar da sensação do quadro principal, você sabe que algo nas outras referências está diluindo o sinal.
Pense no quadro principal como o destino e nas outras referências como o contexto que ajuda o modelo a triangulá-lo. Sem o quadro principal, você está descrevendo uma direção sem um destino.
Adaptando material de origem
A referência com múltiplas imagens é excepcional para adaptar material de origem para vídeo.
Adaptando uma série fotográfica: Envie ao modelo 5-6 fotos da série. Seus clipes de vídeo parecerão continuações da série.
Adaptando o estilo de um filme: Pegue 6-8 fotogramas de um filme específico. Sua geração parecerá pertencer àquele filme.
Adaptando a identidade visual de uma marca: Use as melhores imagens de marketing da marca como referências. O resultado corresponderá à estética da marca sem que você precise descrevê-la.
Adaptando arte conceitual: Envie a arte conceitual como referências. O resultado animado parecerá a arte conceitual em movimento.
O custo não escala com a quantidade de imagens
Vale repetir: você paga pela duração do resultado, não pela quantidade de entradas. 9 imagens custam o mesmo que 1 imagem. A taxa base é de $0,3024 por segundo de vídeo gerado:
| Duração | Créditos | Custo |
|---|---|---|
| 4 segundos | 19 | $1,90 |
| 8 segundos | 37 | $3,70 |
| 15 segundos | 69 | $6,90 |
Portanto, na dúvida, envie a referência extra. É gratuito e, se ajudar o vetor fundido, você ganha.
Múltiplas imagens + referência de movimento + referência de áudio
Você pode combinar os três tipos de entrada em uma única geração. Até 9 imagens, até 3 referências de movimento e até 3 sugestões de áudio. É aqui que o Seedance 2.0 Reference realmente se separa de todos os outros modelos.
Exemplo com configuração completa:
- 9 imagens definindo uma estética Wes Anderson
- 1 vídeo de movimento mostrando um dolly lento e deliberado para a esquerda
- 1 clipe de áudio de uma seção de cordas animada
Mais um prompt mínimo: Um concierge abre a porta de um hotel rosa.
O resultado parecerá 90% com um plano de Wes Anderson sem você precisar digitar "Wes Anderson" em nenhum lugar. Veja nosso guia multimodal para a análise detalhada.
Perguntas frequentes
"Posso usar referências geradas por IA?" Sim. Imagens estáticas do Seedream funcionam muito bem como entrada de referência. Você pode até gerar imagens estáticas primeiro, selecionar as 6 melhores e depois usá-las como referências para vídeo.
"As referências precisam ter a mesma proporção que o resultado?" Não. O modelo extrai o estilo independentemente das dimensões.
"Posso reutilizar um conjunto em diferentes projetos?" Com certeza. Salve seus melhores conjuntos de referências e reutilize-os quando os projetos exigirem aquele estilo. Veja tutorial de consistência de estilo para saber como.
"E se eu tiver apenas 1 imagem de referência?" A referência com múltiplas imagens ainda funciona com 1 imagem, mas você também pode considerar Standard Seedance 2.0, que aceita uma única imagem diretamente.
Sua primeira geração com múltiplas imagens
Escolha um estilo que você ama. Reúna 5-6 imagens que o representem (de qualquer lugar: filmes, fotografia, trabalhos existentes, moodboards). Envie-as para Seedance 2.0 Reference. Escreva um prompt curto descrevendo apenas o sujeito e a ação. Gere com 5 segundos.
Compare o resultado com suas referências. Se o estilo ficou definido, você tem um fluxo de trabalho reproduzível. Se não ficou, refine seu conjunto e tente novamente.
Daqui a dez minutos, você saberá como produzir vídeos com IA que realmente parecem com suas referências em vez de parecerem "vídeo gerado por IA".
Envie 6 imagens e obtenha 1 vídeo correspondente
Teste a referência com múltiplas imagens usando seu próprio moodboard. Créditos gratuitos, sem necessidade de cartão.
Comece a criar gratuitamenteExperimente Seedance 2.0 - Agora mesmo
5 gerações gratuitas · Nenhum cartão de crédito necessário