OmniHuman v1.5: crie avatares de IA realistas a partir de uma única foto
O guia completo do OmniHuman v1.5 no Arteza. Aprenda a criar vídeos de avatares de IA realistas a partir de uma única foto e arquivo de áudio, incluindo recursos, requisitos de entrada, preços, especificações de saída e casos de uso reais.

Uma foto. Um arquivo de áudio. Um vídeo realista com a pessoa falando por $7,20, em planos a partir de $5 por mês, sem fidelização de cartão de crédito e sem contrato anual. Essa é a promessa do OmniHuman v1.5, e este guia mostra exatamente como ele cumpre.
Resumo rápido
- Transforme qualquer foto de retrato mais um arquivo de áudio em um vídeo realista com a pessoa falando
- 3-72 créditos ($0,30-$7,20) por geração - pague apenas quando criar
- 720p com até 60 segundos, ou 1080p com até 30 segundos
- Sincronização labial precisa por fonema, gestos naturais, expressões guiadas pelo áudio
- A partir de $5/mês. Cancele quando quiser, ao contrário do HeyGen ($24-$48/mês) ou do Synthesia ($30-$90/mês)
O que o OmniHuman v1.5 realmente faz
O OmniHuman v1.5 é o modelo de avatar principal da ByteDance, disponível exclusivamente na Arteza. Você faz o upload de uma única foto de retrato e de um arquivo de áudio com fala, e o modelo gera um vídeo completo com a cabeça falante: sincronização labial, piscar de olhos, inclinações de cabeça, movimentos de ombros e micro-expressões, tudo sintetizado do zero.
Isso não é o velho truque de "colar uma boca animada em um rosto estático". Cada quadro é gerado do zero por um transformer de difusão que compreende tanto a identidade quanto o áudio. A pessoa na sua foto se move como um humano real enquanto reproduz exatamente aquele áudio.
Se você já usou Seedance 2.0 para vídeo cinematográfico ou Seedream para geração de imagens, o OmniHuman v1.5 completa o conjunto: texto para imagem, imagem para vídeo e, agora, foto mais áudio para avatar.
Crie seu apresentador com IA agora
Transforme uma foto + áudio em um vídeo realista com a pessoa falando. $7,20 por vídeo de 30 segundos em planos a partir de $5 por mês.
Experimente o OmniHuman grátis5 gerações gratuitas · Nenhum cartão de crédito necessário
Os cinco recursos que realmente importam
1. Sincronização labial em nível de fonema
O modelo extrai fonemas do seu áudio e os mapeia para formatos exatos de boca, quadro a quadro. Plosivas como "p" e "b" mostram o fechamento dos lábios. Fricativas como "f" e "v" mostram os dentes tocando o lábio. Vogais produzem a abertura correta da mandíbula. Quem assiste com o som ligado não vai perceber que o modelo está simulando.
2. Expressões faciais guiadas pelo áudio
Quando o áudio soa entusiasmado, as sobrancelhas se levantam. Quando há uma pausa para ênfase, os olhos se estreitam levemente. Essas pistas são inferidas a partir da prosódia vocal, não fixadas em modelos rígidos.
3. Geração natural de gestos
Movimentos de ombros, viradas de cabeça e sutis mudanças posturais emergem do próprio sinal de fala. Um orador reforçando um ponto se inclina para frente. Quem lista itens muda o peso. O movimento se correlaciona com o significado, não com um temporizador.
4. Modo turbo
Precisa de velocidade para iterar? O modo turbo reduz o tempo de geração sem alterar o custo em créditos. Use-o para testar prompts e entradas, e depois mude para o modo padrão na renderização final.
5. Resolução dupla, duração dupla
| Resolução | Duração máxima do áudio | Ideal para |
|---|---|---|
| 720p (1280x720) | 60 segundos | Clipes para redes sociais, treinamentos, rascunhos |
| 1080p (1920x1080) | 30 segundos | Trabalhos para clientes, demonstrações de produto, marketing |
Como funciona o pipeline
Entender as etapas ajuda você a fornecer entradas melhores ao modelo.
Etapa 1: extração de identidade. Um codificador facial transforma sua foto em um embedding de alta dimensão que captura estrutura óssea, tom de pele, formato dos olhos e centenas de outros marcadores. Esse embedding mantém o rosto consistente em todos os quadros.
Etapa 2: análise de áudio. A faixa de áudio é analisada em busca de fonemas, prosódia, contorno de energia e tom emocional.
Etapa 3: síntese de movimento. Uma rede de movimento transforma os recursos de áudio em parâmetros por quadro para rosto, cabeça e ombros.
Etapa 4: renderização por difusão. Um transformer gera os pixels finais, combinando identidade, movimento e a descrição da cena no seu prompt.
Etapa 5: coerência temporal. Uma passagem de refinamento elimina cintilação, tremidos e deriva de identidade entre os quadros.
O que você precisa fornecer
Foto de referência
- Resolução: mínimo 512x512, idealmente 1024x1024 ou superior
- Composição: cabeça e ombros, rosto ocupando pelo menos 30% do quadro
- Iluminação: luz uniforme e difusa é sempre melhor do que sombras fortes
- Expressão: neutra ou levemente agradável dá ao modelo mais margem para trabalhar
- Formato: JPEG ou PNG
Arquivo de áudio
- Formato: MP3, WAV ou M4A
- Duração: até 60s em 720p, até 30s em 1080p
- Qualidade: fala limpa, sem trilha sonora de fundo nem reverberação excessiva
- Idioma: qualquer idioma falado funciona
Prompt de texto
Descreva a cena: fundo ("escritório moderno com janelas grandes"), iluminação ("luz principal suave vindo da esquerda"), enquadramento ("plano médio, cabeça e ombros") e quaisquer observações de estilo.
Preços: a matemática do pagamento por uso
O OmniHuman v1.5 custa 2,4 créditos por segundo de áudio, ou seja, 72 créditos, aproximadamente $7,20, por um vídeo de 30 segundos na tarifa base. Os créditos vêm com um plano mensal a partir de $5. Você assina, gasta os créditos quando gera e o saldo se renova a cada ciclo de cobrança.
| Plano mensal | Preço | Créditos | Custo efetivo por vídeo de 30 segundos |
|---|---|---|---|
| Starter | $5/mês | 60 | ~$3,83 |
| Creator | $25/mês | 300 | ~$3,83 |
| Pro | $50/mês | 700 | ~$3,29 |
| Studio | $120/mês | 1.800 | ~$3,07 |
Por que isso supera as assinaturas fixas
O HeyGen começa em $24/mês com um limite mensal de minutos. O Synthesia começa em $30/mês. O D-ID começa em $5/mês com uma cota pequena e pode chegar a $300/mês.
Com o OmniHuman v1.5, você não paga nada nos meses em que não criar. Faça um vídeo de 30 segundos por $7,20. Faça dez por $72. Não faça nenhum e não pague nada. Novas contas também ganham 10 créditos grátis no cadastro para explorar Seedream e Seedance 1.0 Lite antes de comprar.
Veja o detalhamento completo no nosso Guia de preços do OmniHuman v1.5.
Quer experimentar o OmniHuman v1.5? Comece a criar gratuitamente →

Quer um apresentador assim? Experimente o OmniHuman gratuitamente →
Passo a passo: seu primeiro vídeo em minutos
- Prepare a foto. Escolha um retrato bem iluminado ou gere um com Seedream.
- Prepare o áudio. Grave você mesmo ou use qualquer TTS de qualidade. Corte os silêncios no início e no fim.
- Abra o modelo. Acesse arteza.ai e escolha o OmniHuman v1.5, ou vá direto para o página do modelo.
- Faça o upload das entradas. Foto, áudio e um prompt curto descrevendo a cena.
- Configure. Escolha 720p ou 1080p e ative o modo turbo se quiser mais velocidade.
- Gere. Alguns minutos depois, seu vídeo estará pronto.
- Revise e baixe. Saída em MP4, pronta para qualquer editor ou plataforma.
Para um tutorial mais detalhado, consulte o tutorial de cabeça falante.
Casos de uso reais que merecem sua atenção
Treinamento corporativo - Vídeos com um apresentador consistente sem precisar agendar gravações. Atualize o conteúdo simplesmente trocando o áudio. Guia completo.
E-learning - Instrutores de cursos podem publicar aulas em escala. Avatares prendem a atenção melhor do que slides estáticos com narração. Guia completo.
Prospecção comercial - Mensagens de vídeo personalizadas que chamam o prospect pelo nome. Guia completo.
Suporte ao cliente - Respostas em vídeo para perguntas frequentes resolvem problemas mais rápido do que artigos de ajuda. Guia completo.
YouTube e podcasts - Co-apresentadores com IA, segmentos explicativos e versões em vídeo de programas de áudio. Veja os guias de YouTube e podcast.
Educação em saúde - Materiais explicativos para pacientes em qualquer idioma, com um rosto confiável e consistente. Guia completo.
Conteúdo multilíngue - Mesma foto, troque o áudio e publique dez versões em idiomas diferentes com identidade visual consistente. Guia completo.
Dicas para melhorar a qualidade do resultado
Seleção da foto
- Iluminação uniforme e suave, sem sombras fortes
- Ângulo frontal ou levemente em três quartos
- Mãos longe do rosto
- Fundo limpo que contraste com o sujeito
Preparação do áudio
- Grave em um ambiente silencioso com reverberação mínima
- Fale em um ritmo natural e inclua pausas reais
- Normalize os níveis para evitar distorção
- Remova música ou ruído ambiente antes de fazer o upload
Escrita do prompt
- Seja específico: "escritório moderno com janelas grandes" é melhor do que "fundo bonito"
- Nomeie a iluminação: "luz de estúdio suave" ou "sol quente da tarde"
- Indique o enquadramento: "plano médio, cabeça e ombros"
- Não contradiga a foto (não descreva uma cor de cabelo diferente)
Iteração
- Use o modo turbo para testes
- Mude uma variável por vez
- Guarde um arquivo com os prompts que funcionaram
OmniHuman v1.5 vs. as alternativas
| Recurso | OmniHuman v1.5 | HeyGen | Synthesia | D-ID |
|---|---|---|---|---|
| Foto personalizada como entrada | Sim | Limitado | Não (avatares predefinidos) | Sim |
| Qualidade da sincronização labial | Excelente | Boa | Boa | Moderada |
| Geração de gestos | Guiada pelo áudio | Baseada em modelos | Baseada em modelos | Limitada |
| Resolução máxima | 1080p | 1080p | 1080p | 1024x1024 |
| Modelo de preços | Pagamento por uso | Assinatura | Assinatura | Misto |
| Custo por vídeo | ~$7,20 por 30s | $24-48/mês | $30-90/mês | $5-300/mês |
| Créditos grátis no cadastro | 10 créditos | Avaliação limitada | Avaliação gratuita | Avaliação limitada |
Comparações diretas:
Escape da armadilha da assinatura mensal
HeyGen, Synthesia e D-ID cobram todo mês, mesmo quando você não faz nenhum vídeo. O OmniHuman v1.5 cobra $7,20 apenas quando você cria.
Gere seu primeiro vídeoLimitações honestas
- Limites de duração. 60s em 720p e 30s em 1080p. Conteúdos mais longos precisam de edição e junção de clipes.
- Uma pessoa por vídeo. Cenas com múltiplos personagens exigem composição.
- Somente parte superior do corpo. Sem animação de corpo inteiro.
- A qualidade do áudio importa. Entrada ruim, sincronização labial ruim.
- Não é em tempo real. As gerações levam minutos, não milissegundos.
- Sem transmissão ao vivo. A saída é um MP4 pré-renderizado.
Perguntas frequentes
Posso usar qualquer foto?
Você pode usar qualquer foto que atenda aos requisitos de entrada, mas é sua responsabilidade garantir os direitos e as permissões necessárias. Os termos de uso da Arteza cobrem os detalhes legais.
Funciona com áudio em outros idiomas além do inglês?
Sim. Qualquer idioma falado funciona, com maior precisão nos idiomas com melhor representação no treinamento. Veja o guia multilíngue.
Posso editar o resultado?
Sim. O resultado é um MP4 padrão. Corte, recorte, componha: o que seu editor suportar.
Existe uma API?
Sim. Consulte o guia de API.
Comece a criar
- Cadastre-se no Arteza e pegue seus 10 créditos grátis
- Assine: o plano Creator de $25 oferece 300 créditos, o suficiente para cerca de 6 vídeos de trinta segundos com OmniHuman
- Prepare uma foto e um arquivo de áudio
- Abra o OmniHuman v1.5
- Faça o upload, configure e gere
Planos acessíveis a partir de $5/mês. Sem mínimo. Apenas $7,20 por vídeo realista de 30 segundos com a pessoa falando, sempre que precisar.
Quer experimentar o OmniHuman v1.5? Comece a criar gratuitamente →
Experimente OmniHuman v1.5 - Agora mesmo
Faça upload da sua imagem de referência na página de criação.
5 gerações gratuitas · Nenhum cartão de crédito necessário