OmniHuman v1.5: Crie Avatares de IA Realistas a Partir de uma Única Foto
Guia completo do OmniHuman v1.5 na Arteza. Aprenda como criar vídeos de avatar de IA realistas a partir de uma única foto e arquivo de áudio, incluindo recursos, requisitos de entrada, preços, especificações de saída e casos de uso do mundo real.

Uma foto. Um arquivo de áudio. Um vídeo realista de uma pessoa falando por $9,60 - planos de assinatura acessíveis, sem bloqueio de cartão de crédito, sem mínimo mensal. Essa é a promessa do OmniHuman v1.5, e este guia mostra exatamente como ele funciona.
RESUMO
- Transforme qualquer foto de retrato mais um arquivo de áudio em um vídeo realista de uma pessoa falando
- 960 créditos ($9,60) por geração - pague apenas quando criar
- 720p até 60 segundos, ou 1080p até 30 segundos
- Sincronização labial precisa em fonemas, gestos naturais, expressões acionadas pelo áudio
- A partir de $5/mês. Cancele a qualquer momento, diferente de HeyGen ($24-$48/mês) ou Synthesia ($30-$90/mês)
O Que o OmniHuman v1.5 Realmente Faz
OmniHuman v1.5 é o modelo de avatar principal do ByteDance, disponível exclusivamente em Arteza. Você carrega uma única foto de retrato e um arquivo de áudio de fala, e o modelo gera um vídeo completo de uma cabeça falando - sincronização labial, piscadas de olhos, inclinações de cabeça, movimentos de ombros e microexpressões, tudo sintetizado do zero.
Isso não é o velho truque de "colar uma boca animada em um rosto estático". Cada quadro é gerado novamente por um transformador de difusão que entende tanto a identidade quanto o áudio. A pessoa em sua foto se move da forma que um humano real se moveria enquanto entrega esse áudio específico.
Se você já usou Seedance 2.0 para vídeo cinematográfico ou Seedream para geração de imagens, OmniHuman v1.5 completa o conjunto: texto para imagem, imagem para vídeo, e agora foto mais áudio para avatar.
Crie seu apresentador de IA agora
Transforme uma foto + áudio em um vídeo realista de uma pessoa falando. $9,60 por vídeo, planos de assinatura acessíveis.
Teste OmniHuman Gratuitamente5 gerações gratuitas · Nenhum cartão de crédito necessário
Os Cinco Recursos Que Importam
1. Sincronização Labial em Nível de Fonema
O modelo extrai fonemas do seu áudio e mapeia-os para formas exatas de boca quadro a quadro. Oclusivas como "p" e "b" mostram fechamento de lábios. Fricativas como "f" e "v" mostram dentes no lábio. Vogais produzem abertura adequada da mandíbula. Espectadores assistindo com som ativado não pegarão o modelo fingindo.
2. Expressões Faciais Acionadas por Áudio
Quando o áudio soa entusiasmado, as sobrancelhas se levantam. Quando há uma pausa para ênfase, os olhos se estreitam levemente. Essas dicas são inferidas da prosódia vocal, não incorporadas em modelos rígidos.
3. Geração Natural de Gestos
Movimentos de ombro, viradas de cabeça e mudanças posturais sutis emergem do sinal de fala em si. Um orador fazendo um ponto se inclina para frente. Um listando itens muda o peso. O movimento se correlaciona com o significado, não com um temporizador.
4. Modo Turbo
Precisa de velocidade para iteração? O modo turbo reduz o tempo de geração sem alterar o custo de 960 créditos. Use-o para visualizar prompts e entradas, depois alterne para modo padrão para a renderização final.
5. Dupla Resolução, Dupla Duração
| Resolução | Duração Máxima de Áudio | Melhor Para |
|---|---|---|
| 720p (1280x720) | 60 segundos | Clipes de redes sociais, treinamento, rascunhos |
| 1080p (1920x1080) | 30 segundos | Trabalho com clientes, demos de produtos, marketing |
Como o Pipeline Funciona
Entender os estágios ajuda você a alimentar melhor o modelo com entradas.
Estágio 1: Extração de identidade. Um codificador facial transforma sua foto em uma incorporação de alta dimensionalidade capturando estrutura óssea, tom de pele, formato de olhos e centenas de outros marcadores. Essa incorporação mantém o rosto consistente em cada quadro.
Estágio 2: Análise de áudio. A faixa de fala é analisada para fonemas, prosódia, contorno de energia e tom emocional.
Estágio 3: Síntese de movimento. Uma rede de movimento transforma características de áudio em parâmetros por quadro para rosto, cabeça e ombros.
Estágio 4: Renderização por difusão. Um transformador gera pixels finais, combinando identidade, movimento e sua descrição de prompt da cena.
Estágio 5: Coerência temporal. Uma passagem de refinamento elimina cintilação, oscilação e desvio de identidade entre quadros.
O Que Você Precisa Fornecer
Foto de Referência
- Resolução: mínimo 512x512, idealmente 1024x1024 ou superior
- Composição: cabeça e ombros, rosto com pelo menos 30% do quadro
- Iluminação: uniforme e difundida vence sombras duras toda vez
- Expressão: neutra ou levemente agradável dá ao modelo mais espaço para trabalhar
- Formato: JPEG ou PNG
Arquivo de Áudio
- Formato: MP3, WAV, ou M4A
- Duração: até 60s em 720p, até 30s em 1080p
- Qualidade: fala limpa sem fundo musical, sem reverberação pesada
- Idioma: qualquer idioma falado funciona
Texto do Prompt
Descreva a cena: fundo ("escritório moderno com grandes janelas"), iluminação ("luz suave de chave da esquerda"), enquadramento ("plano médio, cabeça e ombros") e quaisquer notas de estilo.
Preços: A Matemática de Pagamento por Uso
OmniHuman v1.5 custa 960 créditos por vídeo, equivalente a aproximadamente $9,60 na taxa base. Existem planos de assinatura acessíveis. Você se inscreve, gasta quando gera, e créditos não utilizados permanecem em sua conta.
| Pacote de Créditos | Preço | Créditos | Custo Efetivo por Vídeo |
|---|---|---|---|
| Iniciante | $10 | 1.050 | ~$9,14 |
| Popular | $25 | 2.750 | ~$8,73 |
| Pro | $50 | 5.750 | ~$8,35 |
| Máximo | $100 | 12.000 | ~$8,00 |
Por Que Isso Vence Assinaturas
HeyGen começa em $24/mês com limite de minutos mensais. Synthesia começa em $30/mês. D-ID começa em $5/mês para uma pequena quantidade e escala para $300/mês.
Com OmniHuman v1.5, você não paga nada em meses que não criar. Crie um vídeo por $9,60. Crie dez por $96. Crie zero e pague zero. Contas novas também recebem 50 créditos gratuitos ao se inscrever para explorar Seedream e Seedance 1.0 Lite antes de comprar.
Veja o detalhamento completo em nosso Guia de preços OmniHuman v1.5.
Pronto para experimentar OmniHuman v1.5? Comece a criar gratuitamente →

Quer um apresentador assim? Teste OmniHuman gratuitamente →
Passo a Passo: Seu Primeiro Vídeo em Minutos
- Prepare a foto. Escolha um retrato bem iluminado, ou gere um com Seedream.
- Prepare o áudio. Grave a si mesmo, ou use qualquer TTS de qualidade. Recorte silêncios no início e final.
- Abra o modelo. Vá para arteza.ai e escolha OmniHuman v1.5, ou vá direto para o página do modelo.
- Carregue as entradas. Foto, áudio e um breve prompt de cena.
- Configure. Escolha 720p ou 1080p, alterne turbo se desejar velocidade.
- Gere. Alguns minutos depois, seu vídeo está pronto.
- Revise e baixe. MP4 pronto para qualquer editor ou plataforma.
Para um passo a passo mais detalhado, consulte o tutorial de cabeça falante.
Casos de Uso Reais Vale Sua Atenção
Treinamento corporativo - Vídeos de apresentador consistentes sem agendar sessões de fotos. Atualize o conteúdo trocando áudio. Guia completo.
E-learning - Instrutores de cursos podem entregar aulas em escala. Avatares mantêm atenção melhor que slides estáticos com narração. Guia completo.
Alcance de vendas - Mensagens de vídeo personalizadas que tratam leads pelo nome. Guia completo.
Atendimento ao cliente - Respostas em vídeo para FAQs resolvem problemas mais rápido que artigos de ajuda. Guia completo.
YouTube e podcasting - Co-anfitriões de IA, segmentos explicativos e versões em vídeo de programas de áudio. Veja guias YouTube e podcast.
Educação em saúde - Explicadores de pacientes em qualquer idioma a partir de um rosto único e confiável. Guia completo.
Conteúdo multilíngue - Mesma foto, troque áudio, entregue dez versões de idioma com identidade consistente. Guia completo.
Dicas Que Melhoram a Qualidade da Saída
Seleção de Foto
- Iluminação uniforme e suave sem sombras duras
- De frente ou ângulo levemente de três quartos
- Mãos longe do rosto
- Fundo limpo que contraste com o sujeito
Preparação de Áudio
- Grave em uma sala silenciosa com reverberação mínima
- Fale em um ritmo natural, inclua pausas reais
- Normalize níveis para evitar clipping
- Remova música ou ruído ambiente antes de carregar
Escrita de Prompt
- Seja específico: "escritório moderno com grandes janelas" vence "fundo legal"
- Nomeie a iluminação: "luz suave de estúdio" ou "sol quente à tarde"
- Declare o enquadramento: "close-up médio, cabeça e ombros"
- Não contradiga a foto (não descreva uma cor de cabelo diferente)
Iteração
- Modo turbo para testes
- Mude uma variável por vez
- Mantenha um arquivo de prompts que funcionaram
OmniHuman v1.5 vs as Alternativas
| Recurso | OmniHuman v1.5 | HeyGen | Synthesia | D-ID |
|---|---|---|---|---|
| Entrada de foto customizada | Sim | Limitado | Não (avatares predefinidos) | Sim |
| Qualidade de sincronização labial | Excelente | Boa | Boa | Moderada |
| Geração de gestos | Acionada por áudio | Baseada em template | Baseada em template | Limitada |
| Resolução máxima | 1080p | 1080p | 1080p | 1024x1024 |
| Modelo de preço | Pagamento por uso | Assinatura | Assinatura | Misto |
| Custo por vídeo | ~$8-10 | $24-48/mês | $30-90/mês | $5-300/mês |
| Créditos gratuitos ao inscrever | 50 créditos | Teste limitado | Teste gratuito | Teste limitado |
Comparações lado a lado:
Pule a armadilha de assinatura mensal
HeyGen, Synthesia e D-ID cobram você todo mês, mesmo quando faz zero vídeos. OmniHuman v1.5 cobra $9,60 apenas quando você cria.
Gere Seu Primeiro VídeoLimitações Honestas
- Limites de duração. 60s em 720p, 30s em 1080p. Conteúdo mais longo precisa de junção.
- Uma pessoa por vídeo. Cenas multipessoa requerem composição.
- Apenas metade superior do corpo. Sem animação de corpo inteiro.
- A qualidade do áudio importa. Entrada ruim, sincronização labial ruim.
- Não é tempo real. Gerações levam minutos, não milissegundos.
- Sem transmissão ao vivo. A saída é um MP4 pré-renderizado.
Perguntas Frequentes
Posso usar qualquer foto?
Você pode usar qualquer foto que atenda aos requisitos de entrada, mas você é responsável por direitos e permissões. Os termos de serviço da Arteza cobrem os detalhes legais.
Funciona com áudio em inglês?
Sim. Qualquer idioma falado funciona, com maior precisão em idiomas que têm forte representação de treinamento. Consulte o guia multilíngue.
Posso editar a saída?
Sim. A saída é um MP4 padrão. Recorte, corte, componha - o que seu editor suporta.
Existe uma API?
Sim. Consulte o guia de API.
Comece a Criar
- Inscreva-se no Arteza e pegue seus 50 créditos gratuitos
- Compre créditos - o plano Popular de $25 lhe dá aproximadamente 2-3 vídeos OmniHuman
- Prepare uma foto e arquivo de áudio
- Abra OmniHuman v1.5
- Carregue, configure, gere
Planos acessíveis a partir de $5/mês. Sem mínimo. Apenas $9,60 por vídeo realista de uma pessoa falando, sempre que precisar.
Pronto para experimentar OmniHuman v1.5? Comece a criar gratuitamente →
Try OmniHuman v1.5 - Right Now
Upload your reference image on the create page.
5 free generations · No credit card needed