Como criar vídeos de talking head com IA usando OmniHuman v1.5
Um tutorial passo a passo para criar vídeos profissionais de talking head com IA usando OmniHuman v1.5 no Arteza. Aprenda a selecionar fotos, preparar áudio, escrever prompts e aplicar técnicas de otimização para obter os melhores resultados.

O seu primeiro vídeo de cabeça falante com OmniHuman v1.5 leva cerca de dez minutos do início ao fim, e custa exatamente $0,30-$7,20. Este tutorial mostra cada etapa, cada decisão de entrada e cada truque de qualidade que aprendemos ao gerar milhares de vídeos de cabeça falante na plataforma.
Resumo rápido
- Você precisa de uma foto de rosto, um arquivo de áudio e um prompt de cena curto
- Um vídeo de 30 segundos custa 72 créditos (~$7,20) em planos a partir de $5 por mês
- Escolha 720p para clipes de 60 segundos ou 1080p para clipes de 30 segundos
- Boa foto + áudio limpo + prompt específico = resultado profissional na primeira tentativa
- Modo turbo para iteração, modo padrão para conteúdo final
O que você precisa antes de começar
Três entradas, sem exceções:
- Uma foto de rosto - cabeça e ombros, bem iluminada, mínimo de 512x512 pixels
- Um arquivo de áudio - MP3, WAV ou M4A, voz limpa, até 60 segundos
- Um prompt de cena - uma descrição curta do fundo e da iluminação
Além disso, uma conta Arteza com créditos suficientes para o seu clipe: 2,4 créditos por segundo de áudio, ou seja, 46 créditos para um vídeo de 30 segundos. Novas contas recebem 10 créditos gratuitos ao se cadastrar, o que cobre um clipe de teste curto, e o plano Starter de $5 cobre um mês inteiro de clipes completos.
Crie seu apresentador com IA agora
Transforme uma foto e um áudio em um vídeo realista de pessoa falante. $7,20 por vídeo de 30 segundos em planos a partir de $5 por mês.
Experimente o OmniHuman grátis5 gerações gratuitas · Nenhum cartão de crédito necessário
Etapa 1: escolha ou crie a foto certa
A foto é o maior fator de qualidade em todo o processo. Forneça ao modelo uma ótima foto e ele retornará um ótimo vídeo. Forneça uma foto tirada às pressas com o celular e o resultado vai refletir isso.
O que torna uma boa foto de referência
- Iluminação uniforme. Luz natural difusa ou luz de estúdio suave. Sem sombras duras no rosto.
- Rosto nítido. Olhos abertos, sem reflexo de óculos, sem cabelo cobrindo as feições, sem mãos perto do rosto.
- Enquadramento correto. Cabeça e ombros visíveis. O rosto ocupa pelo menos 30% do quadro.
- Expressão neutra. Um rosto relaxado ou levemente agradável dá ao modelo maior flexibilidade.
- Fundo limpo. Alto contraste entre o sujeito e o fundo ajuda o modelo a isolar a identidade.
- Resolução nítida. 1024x1024 ou maior. Sem desfoque de movimento.
Não tem uma foto? Gere uma
Se você precisar de uma foto de referência que ainda não tem, seja para um porta-voz virtual, uma persona ou um personagem, use Seedream para gerar uma. Escreva o prompt como "foto de perfil profissional de [descrição], iluminação suave de estúdio, fundo neutro, olhando para a câmera" e escolha o resultado mais limpo.
Formatos
JPEG e PNG funcionam. Fundos transparentes são aceitos. A plataforma aceita fotos de até alguns megabytes.
Etapa 2: prepare um áudio limpo
O seu áudio determina a sincronização labial, a expressão facial e o padrão de gestos. Quanto mais limpo for o áudio, mais o modelo tem com que trabalhar.
Opções de gravação
Grave você mesmo. Um ambiente silencioso e um microfone USB decente produzem áudio limpo o suficiente para o OmniHuman. Fale em ritmo natural, com pausas naturais. Não exagere na pronúncia.
Use um serviço de TTS. Qualquer ferramenta de conversão de texto em voz de qualidade funciona: ElevenLabs, Play.ht, Google, Amazon Polly. Exporte em 44,1kHz ou 48kHz mono ou estéreo.
Extraia de um áudio existente. Um trecho de podcast, um clipe de webinar ou uma gravação de narração funcionam, desde que a voz esteja isolada.
O que fazer e o que evitar no áudio
- Faça cortar os silêncios no início e no fim
- Faça normalizar os níveis de áudio para evitar saturação
- Não deixe músicas ou sons ambientes fortes na mixagem
- Não use gravações em ambientes com muita reverberação
- Não ultrapasse o limite de duração: 60s para 720p, 30s para 1080p
Etapa 3: escreva um prompt de cena que ajude
O prompt de cena descreve o ambiente visual ao redor do seu apresentador. Ele não descreve a pessoa: o modelo obtém essa informação a partir da foto.
Estrutura de um bom prompt
Um prompt eficaz inclui quatro elementos:
- Fundo - onde está a pessoa?
- Iluminação - como a cena está iluminada?
- Enquadramento - qual é a proximidade da câmera?
- Estilo - alguma observação sobre o tom ou o acabamento?
Exemplos de prompts que funcionam
Escritório corporativo moderno com janelas amplas, luz natural suave vinda da esquerda, enquadramento médio próximo de cabeça e ombros, estilo de transmissão profissional.
Estúdio minimalista com fundo em gradiente suave, iluminação uniforme de estúdio, plano médio, visual limpo e contemporâneo.
Home office aconchegante com estantes ao fundo, luz dourada da tarde, enquadramento médio próximo, tom natural e acessível.
O que evitar nos prompts
- Não descreva a pessoa (cor do cabelo, idade, roupa): a foto cuida disso
- Não contradiga a foto (não use "fundo branco" se a foto tem fundo preto, a menos que você realmente queira que o modelo o substitua)
- Não use frases vagas como "boa iluminação": escolha uma fonte de luz específica
- Não sobrecarregue o prompt com mais de cinco ou seis detalhes
Etapa 4: faça o upload e configure
Abra arteza.ai e selecione OmniHuman v1.5, ou acesse diretamente página do modelo.
Ordem de upload
- Foto de referência - arraste o retrato para o campo de imagem
- Arquivo de áudio - solte o arquivo de voz no campo de áudio
- Prompt de cena - cole a descrição da cena
Configure as definições
- Resolução: 720p para rascunhos ou clipes com mais de 30s, 1080p para renderizações finais profissionais
- Modo turbo: ativado para iteração, desativado para qualidade final
- Verifique o custo em créditos: a interface confirmará o custo exato em créditos antes de você gerar
Etapa 5: gere e revise
Clique em gerar. O modo padrão leva alguns minutos. O modo turbo é mais rápido. Você receberá uma notificação quando o vídeo estiver pronto.
Revisando o resultado
Reproduza o vídeo em tamanho completo e verifique estas quatro coisas:
- Sincronização labial - os formatos da boca correspondem aos fonemas?
- Identidade - o rosto se parece com a referência ao longo de todo o vídeo?
- Naturalidade dos gestos - o movimento parece orgânico, não robótico?
- Consistência do fundo - a cena corresponde ao seu prompt?
Se algo parecer errado, a solução quase sempre está nas entradas, não em rolar novamente. Troque a foto, limpe o áudio ou refine o prompt.
Pronto para experimentar o OmniHuman v1.5? Comece a criar grátis →

Quer um apresentador assim? Experimente o OmniHuman grátis →
Dicas avançadas de fluxos de produção reais
Use o modo turbo para exploração e o modo padrão para os finais
O modo turbo custa o mesmo que o modo padrão para o mesmo áudio, mas reduz o tempo de espera. Use-o para testar diferentes prompts ou takes de áudio rapidamente, e então renderize a versão final no modo padrão.
Combine a emoção do áudio com a expressão da foto de referência
Se a sua foto mostra um rosto neutro, mas o seu áudio é muito animado, o modelo gerará muito movimento. Se o áudio é calmo e a foto está sorrindo, espere variações sutis. Combine os dois para obter resultados previsíveis.
Divida conteúdos longos em segmentos
Precisa de um vídeo de 90 segundos? Divida o áudio em dois segmentos (por exemplo, 45s cada), gere dois clipes em 720p e una-os em qualquer editor de vídeo. A identidade permanece consistente porque você está usando a mesma foto de referência.
Prepare várias fotos para a mesma pessoa
Ter três ou quatro fotos de referência da mesma pessoa, com roupas diferentes, iluminações diferentes e expressões diferentes, permite que você combine a foto ao tom do conteúdo. Uma anedota calorosa recebe uma foto mais calorosa; uma atualização corporativa recebe a foto de perfil.
Mantenha uma biblioteca de prompts
Salve os prompts de cena que funcionaram. "Gradiente de estúdio minimalista" ou "luz de janela em escritório moderno" podem ser reutilizados em vários projetos para manter a consistência visual.
Erros comuns e como corrigi-los
A sincronização labial parece levemente desalinhada
- Verifique a qualidade do áudio. Ruídos, artefatos de compressão ou baixa taxa de bits prejudicam a extração de fonemas
- Verifique a duração. Clipes exatamente no limite podem ser cortados no último quadro: mire um segundo abaixo do limite
- Tente uma gravação mais limpa ou exporte com taxa de bits mais alta
O rosto parece "plástico" ou suave demais
- Use uma foto de maior resolução. Entradas abaixo de 512px produzem resultados com pouco detalhe
- Ajuste a iluminação no prompt para "natural" em vez de "estúdio" para mais textura
Os gestos parecem sutis demais
- Use áudio mais expressivo. Uma voz monótona produz variação mínima de gestos
- Escolha uma foto com postura levemente aberta em vez de um enquadramento frontal rígido
O fundo não corresponde ao prompt
- Seja mais específico. "Escritório" é vago; "escritório moderno com uma estante atrás do sujeito e uma janela grande à esquerda" é algo concreto
- Combine o contexto da foto. O modelo usa o fundo da foto como referência
Cálculo de custos para diferentes projetos
Cada vídeo do OmniHuman v1.5 custa 3-72 créditos ($0,30-$7,20). Veja como isso se traduz na prática:
| Projeto | Vídeos necessários | Custo total |
|---|---|---|
| Publicação única no LinkedIn | 1 | $7,20 |
| Série de boas-vindas com cinco vídeos | 5 | $36 |
| Curso com dez aulas | 10 | $72 |
| Atualizações semanais durante um ano | 52 | $499,20 |
Compare isso com os $24 a $48 mensais do HeyGen (mesmo nos meses em que você não cria nada) ou os $30 a $90 mensais do Synthesia. Em volumes baixos e moderados, o OmniHuman economiza centenas de dólares por ano. Consulte detalhamento completo de preços para conhecer cada nível.
Pague por vídeo, não por mês
Um vídeo de cabeça falante de 30 segundos custa $7,20, em planos a partir de $5 por mês sem contrato anual. Os créditos mensais se renovam a cada ciclo de cobrança. Os créditos avulsos nunca expiram.
Gere seu primeiro vídeoLista de verificação do seu primeiro vídeo
- Foto de rosto, 1024x1024 ou maior, bem iluminada, expressão neutra
- Arquivo de áudio limpo, menos de 60 segundos, sem música ou reverberação
- Prompt de cena com fundo, iluminação, enquadramento e estilo
- Conta Arteza com pelo menos 72 créditos
- Escolha de resolução (720p ou 1080p)
- Decisão sobre o modo turbo
- Abra OmniHuman v1.5 e gere
Depois de lançar o seu primeiro vídeo de cabeça falante, explore guia técnico de sincronização labial, guia de fluxo de trabalho multilíngue e tutoriais específicos por caso de uso como âncoras de notícias e treinamento corporativo.
Pronto para experimentar o OmniHuman v1.5? Comece a criar grátis →
Experimente OmniHuman v1.5 - Agora mesmo
Faça upload da sua imagem de referência na página de criação.
5 gerações gratuitas · Nenhum cartão de crédito necessário