Vídeo de IA multimodal: combinando imagens, vídeo e áudio com Arteza
O verdadeiro vídeo de IA multimodal significa fornecer ao modelo mais do que apenas um prompt. Veja como combinar imagens, vídeo e referências de áudio no Seedance 2.0 Reference.

"Multi-modal" é usado de forma vaga no marketing de IA. A maioria das ferramentas que reivindicam isso na verdade quer dizer "aceitamos texto e uma imagem". O Seedance 2.0 Reference é um dos poucos modelos que leva o termo a sério: até 9 imagens, 3 clipes de vídeo e 3 clipes de áudio, todos fundidos em uma única geração.
Veja como usar os três tipos de entrada juntos na prática, e por que essa combinação desbloqueia possibilidades que nenhuma entrada isolada consegue.
Resumo rápido
- O Seedance 2.0 Reference aceita imagens + vídeo + áudio como referência em uma única chamada
- Imagens definem o estilo, vídeo define o movimento, áudio define o clima
- Combinar os três produz resultados mais precisos do que qualquer tipo de entrada isolado
- Preço: $0,3024/seg, independentemente de quantas referências você usar
- Geração: 60-180 segundos para o pipeline multi-modal fundido
- Experimente gratuitamente a stack multi-modal completa
O que cada tipo de entrada realmente controla
Esses três tipos de referência não se sobrepõem, eles lidam com dimensões diferentes do resultado.
Imagens controlam o estilo. Paleta de cores, iluminação, composição, textura, enquadramento. Tudo que é visual e não envolve movimento.
Vídeo controla o movimento. Movimentos de câmera, ritmo, vetores de ação, cadência temporal. Não a cor nem a iluminação, o modelo extrai o movimento de forma independente do estilo visual do vídeo.
Áudio controla o clima. Um viés emocional que influencia sutilmente o resultado visual. Não é o som que você ouve na saída (esse é gerado separadamente), mas a pista de humor que influencia o que aparece na tela.
Quando você usa os três juntos, cada um preenche uma lacuna que os outros não conseguem.
5 gerações gratuitas · Nenhum cartão de crédito necessário
O conjunto em ação
Aqui está uma geração multi-modal concreta que realizei.
Objetivo: Uma tomada onírica em câmera lenta de uma mulher correndo por um campo ao amanhecer, no estilo de um filme de Terrence Malick.
Referências de imagem (6):
- 2 fotogramas de filmes do Malick mostrando luz quente do amanhecer
- 2 imagens de campos na hora dourada
- 1 tomada com o caráter de lente exato que eu queria (bokeh suave e onírico)
- 1 quadro principal mostrando o clima preciso
Referências de vídeo (1):
- Um clipe de 3 segundos de uma figura correndo em câmera lenta filmada com uma lente longa
Referências de áudio (1):
- 4 segundos de piano suave e esparso
Prompt:
A woman in a white dress runs through tall grass at dawn, 8 seconds
Perceba como o prompt é mínimo. As referências cuidam de todo o resto.
O resultado ficou surpreendentemente próximo da intenção: o estilo veio das imagens, a sensação específica de corrida em câmera lenta veio do vídeo, e um peso emocional sutil veio do áudio, algo que eu não teria conseguido apenas com imagens.

Experimente o conjunto multi-modal completo. Faça upload de imagens, um clipe de movimento e uma referência de áudio em uma única tentativa. Comece de graça com 10 créditos.
Referências de imagem: a base
As imagens são a entrada com maior peso na fusão. Devem ser sempre o seu canal principal de estilo. Use no mínimo 4-6, chegando até 9 para estilos complexos.
Consulte o tutorial de múltiplas imagens dedicado para a metodologia completa de curadoria de imagens. Resumo: coerência importa mais do que quantidade, cubra diferentes facetas do estilo e inclua um quadro principal.
Referências de vídeo: a camada de movimento
As referências de vídeo são onde o multi-modal realmente se separa dos fluxos baseados apenas em imagens. Descrever movimento de câmera em palavras é genuinamente difícil: "uma deriva suave à mão para a esquerda enquanto sobe sutilmente" perde fidelidade toda vez que você o traduz para prosa.
Uma referência de vídeo de 2-5 segundos elimina essa tradução. O modelo amostra os vetores de movimento diretamente.
Melhores usos:
- Sensação específica de câmera na mão que você quer reproduzir
- Movimentos de câmera difíceis (guinadas, combinações de dolly e pan, transições em chicote)
- Pistas de ritmo (sensação de cortes rápidos versus sensação contemplativa e lenta)
- Ritmo de ação para conteúdo esportivo ou de dança
O que as referências de vídeo não fazem:
- Não carregam estilo próprio. A gradação de cor da referência não é transferida, apenas o movimento.
- Não ditam o conteúdo. O sujeito da referência não aparece no seu resultado.
Você pode usar até 3 referências de vídeo por geração. Empilhar múltiplas referências de movimento as mescla, o que é útil para obter algo "entre" dois movimentos de referência.
Referências de áudio: a camada de clima
As referências de áudio são as mais incomuns das três. Elas não aparecem na faixa de áudio do seu resultado (essa é gerada do zero para combinar com a cena). Em vez disso, elas influenciam emocionalmente os visuais.
Uma referência de áudio tempestuosa favorece iluminação dramática e paleta mais escura. Uma referência animada e alegre favorece enquadramento mais luminoso e mais movimento. Uma referência esparsa e melancólica favorece tomadas mais longas e lentas com tons mais frios.
Quando usá-las:
- As referências de estilo e o prompt estão sólidos, mas o resultado parece emocionalmente vazio
- Você quer um clima difícil de descrever visualmente
- Você está combinando o resultado com uma trilha sonora ou música existente
Quando pular:
- Nas suas primeiras gerações. Comece apenas com imagens. Adicione referências de áudio assim que estiver confortável com a linha de base.
Até 3 referências de áudio por geração, mescladas entre si.
Experimente o Seedance 2.0 Reference: geração de vídeo multi-modal
Combine imagens, vídeo e referências de áudio em uma única geração. Créditos gratuitos, sem necessidade de cartão.
Experimente o Seedance 2.0 Reference grátisÁrvore de decisão multi-modal
Nem todo projeto precisa dos três tipos de entrada. Veja quando adicionar cada um:
Sempre: Referências de imagem (mínimo de 3) Adicione referência de vídeo se: Você precisa de um movimento específico que é difícil de descrever Adicione referência de áudio se: O resultado parece emocionalmente inadequado após tentativas só com imagens
Não force o multi-modal quando um conjunto mais simples funciona. Gerações apenas com imagens são mais rápidas de configurar e frequentemente suficientes.
Erros comuns com multi-modal
Contradizer as imagens com o vídeo. Se suas imagens são sombrias e lentas, mas sua referência de vídeo é rápida e luminosa, a fusão fica confusa. Escolha entradas que concordem entre si.
Usar referências de vídeo para estilo. Elas são apenas para movimento. O estilo ainda vem das imagens.
Usar referências de áudio em excesso. Uma única pista de áudio precisa é mais eficaz do que 3 conflitantes.
Deixar o prompt em branco. As referências definem o como, o prompt ainda define o quê. Não deixe o prompt vazio.
Custo e tempo de geração
O preço do multi-modal é idêntico ao de qualquer outra chamada no modo Reference: $0,3024 por segundo de saída. Adicionar referências de vídeo e áudio não tem custo extra.
| Duração | Créditos | Custo |
|---|---|---|
| 4 seg | 19 | $1,90 |
| 8 seg | 37 | $3,70 |
| 15 seg | 69 | $6,90 |
O tempo de geração é ligeiramente maior do que o de apenas imagens, porque a fusão processa mais dados. Espere 90-180 segundos para chamadas multi-modal, contra 60-120 para apenas imagens.
Um fluxo de produção multi-modal completo
Para um projeto de 10 clipes em que cada clipe precisa ser coerente:
1. Monte seu pacote de referências (uma vez, reutilize para todos os 10 clipes):
- 6 imagens definindo o estilo
- 2 referências de vídeo para os movimentos de câmera mais usados
- 1 referência de áudio para o tom emocional
2. Escreva 10 prompts específicos para cada tomada, descrevendo apenas o sujeito e a ação.
3. Execute todas as 10 gerações usando o mesmo pacote de referências, variando apenas o prompt.
4. Revise e itere nos clipes que desviaram. Normalmente 1-2 a cada 10.
Custo total para 10 clipes de 8 segundos: aproximadamente 4.840 créditos = aproximadamente $48. Isso cabe no $50 Pro tier com troco.
Comparação: multi-modal versus padrão
| Recurso | Seedance 2.0 padrão | Reference (multi-modal) |
|---|---|---|
| Controle de estilo | Apenas prompt | Até 9 imagens |
| Controle de movimento | Apenas prompt | Até 3 refs de vídeo |
| Controle de clima | Apenas prompt | Até 3 refs de áudio |
| Complexidade de configuração | Baixa | Moderada |
| Precisão do resultado | Moderada | Alta |
| Ideal para | Trabalhos pontuais | Trabalhos de precisão |
O padrão é mais rápido para ideias simples. O multi-modal Reference é a opção de precisão quando você precisa que o resultado corresponda a uma intenção específica. Veja o Comparação entre Reference e Standard completo.
Avançado: empilhando referências ao longo de uma sequência
Para sequências de múltiplas tomadas com momentos distintos, você pode alterar seu conjunto multi-modal entre tomadas mantendo um elemento constante.
Constante ao longo da sequência: 5-6 imagens de estilo (para consistência visual) Variável por tomada: 1-2 imagens específicas da tomada + 1 referência de movimento
As imagens constantes mantêm a sequência unida. As referências variáveis permitem capturar nuances específicas de cada tomada. Esse é o fluxo de trabalho em que a maioria dos usuários profissionais acaba chegando.
Por onde continuar
Se esta é sua primeira vez com multi-modal, comece pequeno. Experimente primeiro gerações apenas com imagens (tutorial de múltiplas imagens). Quando se sentir confortável, adicione uma referência de movimento. Quando estiver obtendo resultados confiáveis, experimente o áudio.
Para ter a visão completa dos recursos, leia o Guia do Seedance 2.0 Reference. Para casos de uso específicos, consulte o vídeos de marca ou o videoclipes.
Multi-modal não é um recurso de marketing: é o que separa o Seedance 2.0 Reference de todas as outras ferramentas de vídeo com IA do mercado. Use-o quando a precisão importa.
Combine imagens, vídeo e áudio em uma única chamada
Veja como a entrada multi-modal define com precisão o resultado do seu vídeo com IA. Créditos gratuitos, sem necessidade de cartão.
Comece a criar grátisExperimente Seedance 2.0 - Agora mesmo
5 gerações gratuitas · Nenhum cartão de crédito necessário