Como Criar Vídeos de Cabeça Falante com IA usando OmniHuman v1.5
Um tutorial passo a passo para criar vídeos profissionais de cabeça falante com IA usando OmniHuman v1.5 no Arteza. Aprenda seleção de fotos, preparação de áudio, redação de prompts e técnicas de otimização para os melhores resultados.

Seu primeiro vídeo de talking head OmniHuman v1.5 leva cerca de dez minutos do início ao fim - e custa exatamente $9,60. Este tutorial mostra cada etapa, cada decisão de entrada e cada truque de qualidade que aprendemos ao gerar milhares de vídeos de talking head na plataforma.
TL;DR
- Você precisa de uma foto de retrato, um arquivo de áudio e um prompt de cena curto
- Cada geração custa 960 créditos (~$9,60) - planos de assinatura acessíveis
- Escolha 720p para clipes de 60 segundos ou 1080p para clipes de 30 segundos
- Boa foto + áudio limpo + prompt específico = resultado profissional na primeira tentativa
- Modo Turbo para iteração, modo padrão para conteúdo hero
O Que Você Precisa Antes de Começar
Três entradas, sem exceções:
- Uma foto de retrato - cabeça e ombros, bem iluminada, mínimo 512x512 pixels
- Um arquivo de áudio - MP3, WAV ou M4A, fala limpa, até 60 segundos
- Um prompt de cena - uma breve descrição do fundo e iluminação
Além de uma conta Arteza com pelo menos 960 créditos. Novas contas recebem 50 créditos grátis no cadastro, mas um talking head custa 960, portanto você precisará de pelo menos um pacote Starter de $10 para executar seu primeiro vídeo.
Crie seu apresentador de IA agora
Transforme uma foto + áudio em um vídeo de fala realista. $9,60 por vídeo, planos de assinatura acessíveis.
Experimente OmniHuman Grátis5 gerações gratuitas · Nenhum cartão de crédito necessário
Etapa 1: Escolha ou Crie a Foto Certa
A foto é a alavanca de qualidade única mais importante em todo o fluxo de trabalho. Alimente o modelo com uma ótima foto e ele retornará um ótimo vídeo. Alimente-o com uma foto de celular apressada e a saída refletirá isso.
O Que Torna uma Ótima Foto de Referência
- Iluminação uniforme. Luz natural difusa ou luz de estúdio suave. Sem sombras duras no rosto.
- Rosto claro. Olhos abertos, sem brilho de óculos, sem cabelo cobrindo os recursos, sem mãos perto do rosto.
- Enquadramento correto. Cabeça e ombros visíveis. O rosto ocupa pelo menos 30% do quadro.
- Expressão neutra. Um rosto relaxado ou levemente agradável dá ao modelo a máxima flexibilidade.
- Fundo limpo. Alto contraste entre o sujeito e o fundo ajuda o modelo a isolar a identidade.
- Resolução nítida. 1024x1024 ou maior. Sem desfoque de movimento.
Não Tem uma Foto? Gere Uma
Se você precisar de uma foto de referência que não possui - para um porta-voz virtual, uma persona ou um personagem - use Seedream para gerar uma. Peça por "professional headshot of [description], soft studio lighting, neutral background, looking at camera" e escolha o resultado mais limpo.
Formatos
JPEG e PNG funcionam. Fundos transparentes são aceitáveis. A plataforma aceita fotos de até vários megabytes.
Etapa 2: Prepare Áudio Limpo
Seu áudio determina a sincronização labial, a expressão facial e o padrão de gestos. Quanto mais limpo o áudio, mais o modelo tem para trabalhar.
Opções de Gravação
Grave a si mesmo. Uma sala tranquila e um microfone USB decente produzirão áudio limpo o suficiente para OmniHuman. Fale em um ritmo natural, com pausas naturais. Não sobreartícule.
Use um serviço de TTS. Qualquer ferramenta de síntese de fala de qualidade funciona - ElevenLabs, Play.ht, Google, Amazon Polly. Exporte em 44.1kHz ou 48kHz mono ou estéreo.
Extraia de áudio existente. Um segmento de podcast, um clipe de webinar ou uma gravação de dublagem funcionam desde que a fala seja isolada.
Orientações de Áudio
- Faça aparar o silêncio no início e no final
- Faça normalizar os níveis de áudio para evitar cortes
- Não deixe música ou sons ambiente pesados na mistura
- Não use gravações de sala com muito reverb
- Não exceda o limite de duração: 60s para 720p, 30s para 1080p
Etapa 3: Escreva um Prompt de Cena Que Ajude
O prompt de cena descreve o ambiente visual ao redor de seu apresentador. Ele não descreve a pessoa - o modelo obtém isso da foto.
Boa Estrutura de Prompt
Um prompt forte inclui quatro elementos:
- Fundo - onde está a pessoa?
- Iluminação - como a cena é iluminada?
- Enquadramento - quão próxima está a câmera?
- Estilo - alguma nota sobre tom ou acabamento?
Prompts de Exemplo Que Funcionam
Escritório corporativo moderno com grandes janelas, iluminação natural suave da esquerda, enquadramento de close médio cabeça e ombros, estilo de transmissão profissional. Ambiente de estúdio minimalista com um fundo de gradiente suave, iluminação de estúdio uniforme, plano médio, aspecto limpo e contemporâneo. Escritório aconchegante em casa com estantes de livros ao fundo, luz solar dourada da tarde, close-up médio, tom natural e acessível.
O Que Evitar em Prompts
- Não descreva a pessoa (cor de cabelo, idade, roupa) - a foto cuida disso
- Não contradiga a foto (nenhum "fundo branco" se a foto tiver fundo preto, a menos que você realmente queira que o modelo o substitua)
- Não use frases vagas como "boa iluminação" - escolha uma fonte de luz específica
- Não sobrecarregue o prompt com mais de cinco ou seis detalhes
Etapa 4: Carregue e Configure
Abra arteza.ai e selecione OmniHuman v1.5, ou vá direto para o página do modelo.
Ordem de Upload
- Foto de referência - arraste o retrato para o slot de imagem
- Arquivo de áudio - solte o arquivo de fala no slot de áudio
- Prompt de cena - cole sua descrição de cena
Configure as Configurações
- Resolução: 720p para rascunhos ou clipes com mais de 30s, 1080p para renderizações finais profissionais
- Modo Turbo: ativado para iteração, desativado para qualidade final
- Custo de crédito de revisão: a interface confirmará 960 créditos antes de você gerar
Etapa 5: Gere e Revise
Clique em gerar. O modo padrão leva alguns minutos. O modo Turbo é mais rápido. Você receberá uma notificação quando o vídeo estiver pronto.
Revisando a Saída
Reproduza o vídeo em tamanho completo e verifique essas quatro coisas:
- Sincronização labial - as formas da boca combinam com os fonemas?
- Identidade - o rosto se parece com o de referência em todo momento?
- Naturalismo do gesto - o movimento parece orgânico, não robótico?
- Consistência de fundo - a cena corresponde ao seu prompt?
Se algo parecer errado, a correção quase sempre está nas entradas, não em uma reformulação. Troque a foto, limpe o áudio ou aperte o prompt.
Pronto para tentar OmniHuman v1.5? Comece a criar gratuitamente →

Quer um apresentador assim? Experimente OmniHuman gratuitamente →
Dicas Avançadas de Fluxos de Trabalho de Produção Reais
Use Turbo para Exploração, Padrão para Finais
O modo Turbo ainda custa 960 créditos por geração, mas reduz a espera. Use-o para testar rapidamente diferentes prompts ou takes de áudio, depois renderize a versão final no modo padrão.
Combine Emoção de Áudio com Expressão de Referência
Se sua foto mostra um rosto neutro, mas seu áudio é altamente animado, o modelo gerará muitos movimentos. Se o áudio é calmo e a foto está sorrindo, espere variação sutil. Combine-os para resultados previsíveis.
Divida Conteúdo Longo em Segmentos
Precisa de um vídeo de 90 segundos? Divida o áudio em dois segmentos (por exemplo, 45s cada), gere dois clipes de 720p e costure-os em qualquer editor de vídeo. A identidade permanece consistente porque você está usando a mesma foto de referência.
Prepare Várias Fotos da Mesma Pessoa
Ter três ou quatro fotos de referência da mesma pessoa - diferentes roupas, iluminação diferente, expressões diferentes - permite corresponder a foto ao tom do conteúdo. Uma anedota calorosa recebe uma foto mais calorosa; uma atualização corporativa recebe o retrato.
Mantenha uma Biblioteca de Prompts
Salve os prompts de cena que funcionaram. "Gradiente de estúdio minimalista" ou "luz de janela de escritório moderno" podem ser reutilizados em projetos para consistência visual.
Erros Comuns e Como Corrigi-los
Sincronização labial parece ligeiramente desalinhada
- Verifique a qualidade do áudio. Ruído, artefatos de compressão ou baixa taxa de bits prejudicam a extração de fonema
- Verifique a duração. Clipes exatamente no limite podem ser cortados no último quadro - procure estar um segundo abaixo
- Tente uma gravação mais limpa ou re-exporte em taxa de bits mais alta
Rosto parece "plástico" ou muito suave
- Use uma foto de resolução mais alta. Entrada abaixo de 512px produz saída suave
- Ajuste a iluminação do prompt para "natural" em vez de "studio" para mais textura
Gestos parecem muito sutis
- Use áudio mais expressivo. A fala monótona produz variação de gesto mínima
- Selecione uma foto com postura ligeiramente aberta em vez de enquadramento frontal rígido
Fundo não corresponde ao prompt
- Seja mais específico. "Escritório" é vago; "escritório moderno com uma estante atrás do sujeito e uma grande janela à esquerda" é prático
- Combine contexto de foto. O modelo pondera o fundo da foto como referência
Matemática de Custo para Diferentes Projetos
Cada vídeo OmniHuman v1.5 custa 960 créditos (~$9,60). Aqui está como fica na prática:
| Projeto | Vídeos Necessários | Custo Total |
|---|---|---|
| Único post no LinkedIn | 1 | $9,60 |
| Série de boas-vindas com cinco vídeos | 5 | $48 |
| Curso com dez lições | 10 | $96 |
| Atualizações semanais por um ano | 52 | $499,20 |
Compare com $24-$48 por mês da HeyGen (mesmo nos meses em que você não cria nada) ou $30-$90 por mês da Synthesia. Em volumes baixos e moderados, OmniHuman economiza centenas por ano. Veja o detalhamento completo de preços para cada tier.
Pague por vídeo, não por mês
Cada talking head é $9,60 - planos de assinatura acessíveis para cancelar, sem mínimo mensal. Os créditos mensais se renovam a cada ciclo de faturamento. Os créditos de recarga nunca expiram.
Gere Seu Primeiro VídeoSeu Primeiro Checklist de Vídeo
- Foto de retrato, 1024x1024 ou maior, bem iluminada, expressão neutra
- Arquivo de áudio limpo, menos de 60 segundos, sem música ou reverb
- Prompt de cena com fundo, iluminação, enquadramento, estilo
- Conta Arteza com pelo menos 960 créditos
- Escolha de resolução (720p ou 1080p)
- Decisão de modo Turbo
- Abra OmniHuman v1.5 e gere
Depois de entregar seu primeiro talking head, explore o guia técnico de sincronização labial, o guia de fluxo de trabalho multilíngue e tutoriais específicos de caso de uso como âncoras de notícias e treinamento corporativo.
Pronto para tentar OmniHuman v1.5? Comece a criar gratuitamente →
Try OmniHuman v1.5 - Right Now
Upload your reference image on the create page.
5 free generations · No credit card needed