OmniHuman v1.5: crea avatares de IA realistas desde una sola foto
La guía completa de OmniHuman v1.5 en Arteza. Aprende a crear videos de avatares de IA realistas desde una sola foto y un archivo de audio, incluyendo características, requisitos de entrada, precios, especificaciones de salida y casos de uso reales.

Una foto. Un archivo de audio. Un video realista con tu presentador hablando por $7.20, en planes que comienzan desde $5 al mes, sin bloqueo de tarjeta de crédito y sin contrato anual. Esa es la promesa de OmniHuman v1.5, y esta guía te muestra exactamente cómo la cumple.
Resumen rápido
- Convierte cualquier foto de perfil más un archivo de audio en un video hablado ultrarrealista
- 3-72 créditos ($0,30-$7,20) por generación: solo pagas cuando creas
- 720p hasta 60 segundos, o 1080p hasta 30 segundos
- Sincronización labial precisa por fonemas, gestos naturales, expresiones guiadas por el audio
- Desde $5/mes. Cancela cuando quieras, a diferencia de HeyGen ($24-$48/mes) o Synthesia ($30-$90/mes)
Qué hace realmente OmniHuman v1.5
OmniHuman v1.5 es el modelo de avatar insignia de ByteDance, disponible exclusivamente en Arteza. Subes una sola foto de perfil y un archivo de audio con voz, y el modelo genera un video completo con la cabeza hablante: sincronización labial, parpadeos, inclinaciones de cabeza, movimientos de hombros y microexpresiones, todo sintetizado desde cero.
Esto no es el viejo truco de «pegar una boca animada sobre una cara estática». Cada fotograma es generado de nuevo por un transformer de difusión que entiende tanto la identidad como el audio. La persona de tu foto se mueve como lo haría un ser humano real mientras pronuncia ese audio específico.
Si ya has usado Seedance 2.0 para video cinematográfico o Seedream para generación de imágenes, OmniHuman v1.5 completa el conjunto: texto a imagen, imagen a video, y ahora foto más audio para crear un avatar.
Crea tu presentador de IA ahora
Convierte una foto + audio en un video hablado ultrarrealista. $7.20 por video de 30 segundos en planes desde $5 al mes.
Prueba OmniHuman gratis5 generaciones gratis · Sin tarjeta de crédito
Las cinco funciones que importan
1. Sincronización labial a nivel de fonema
El modelo extrae fonemas de tu audio y los mapea a las formas exactas de la boca fotograma a fotograma. Las oclusivas como «p» y «b» muestran el cierre de labios. Las fricativas como «f» y «v» muestran los dientes sobre el labio. Las vocales producen la apertura correcta de la mandíbula. Los espectadores que vean el video con sonido no notarán ninguna falsificación.
2. Expresiones faciales guiadas por el audio
Cuando el audio suena entusiasta, las cejas se levantan. Cuando hay una pausa para dar énfasis, los ojos se entrecierran ligeramente. Estas señales se infieren de la prosodia vocal, no están fijadas en plantillas rígidas.
3. Generación natural de gestos
Los movimientos de hombros, los giros de cabeza y los cambios posturales sutiles emergen de la propia señal de voz. Un orador que está haciendo un punto importante se inclina hacia adelante. Uno que enumera elementos desplaza el peso. El movimiento se correlaciona con el significado, no con un temporizador.
4. Modo turbo
¿Necesitas velocidad para iterar? El modo turbo reduce el tiempo de generación sin cambiar el costo en créditos. Úsalo para previsualizar prompts e inputs y luego cambia al modo estándar para el render definitivo.
5. Resolución dual, duración dual
| Resolución | Duración máxima de audio | Ideal para |
|---|---|---|
| 720p (1280x720) | 60 segundos | Clips para redes, formación, borradores |
| 1080p (1920x1080) | 30 segundos | Trabajos para clientes, demos de producto, marketing |
Cómo funciona el proceso
Entender las etapas te ayuda a darle al modelo mejores inputs.
Etapa 1: Extracción de identidad. Un codificador facial convierte tu foto en un embedding de alta dimensión que captura la estructura ósea, el tono de piel, la forma de los ojos y cientos de otros marcadores. Este embedding mantiene el rostro coherente en cada fotograma.
Etapa 2: Análisis de audio. La pista de voz se analiza en busca de fonemas, prosodia, contorno de energía y tono emocional.
Etapa 3: Síntesis de movimiento. Una red de movimiento convierte las características del audio en parámetros por fotograma para el rostro, la cabeza y los hombros.
Etapa 4: Renderizado por difusión. Un transformer genera los píxeles finales combinando identidad, movimiento y la descripción de la escena de tu prompt.
Etapa 5: Coherencia temporal. Un pase de refinamiento elimina el parpadeo, las sacudidas y la deriva de identidad entre fotogramas.
Qué necesitas aportar
Foto de referencia
- Resolución: mínimo 512x512, idealmente 1024x1024 o superior
- Composición: cabeza y hombros, el rostro debe ocupar al menos el 30% del encuadre
- Iluminación: uniforme y difusa supera siempre a las sombras duras
- Expresión: neutral o levemente agradable le da al modelo el máximo margen de trabajo
- Formato: JPEG o PNG
Archivo de audio
- Formato: MP3, WAV o M4A
- Duración: hasta 60 s a 720p, hasta 30 s a 1080p
- Calidad: voz limpia sin música de fondo ni reverberación excesiva
- Idioma: funciona con cualquier idioma hablado
Prompt de texto
Describe la escena: fondo («oficina moderna con grandes ventanales»), iluminación («luz clave suave desde la izquierda»), encuadre («plano medio, cabeza y hombros») y cualquier nota de estilo.
Precios: las matemáticas del pago por uso
OmniHuman v1.5 cuesta 2,4 créditos por segundo de audio, es decir, 72 créditos, o aproximadamente $7.20, por un video de 30 segundos a la tarifa base. Los créditos vienen incluidos en un plan mensual desde $5. Te suscribes, los gastas cuando generas y el saldo se renueva en cada ciclo de facturación.
| Plan mensual | Precio | Créditos | Costo efectivo por video de 30 segundos |
|---|---|---|---|
| Starter | $5/mes | 60 | ~$3.83 |
| Creator | $25/mes | 300 | ~$3.83 |
| Pro | $50/mes | 700 | ~$3.29 |
| Studio | $120/mes | 1,800 | ~$3.07 |
Por qué esto supera a las suscripciones fijas
HeyGen comienza en $24/mes con un límite mensual de minutos. Synthesia comienza en $30/mes. D-ID comienza en $5/mes con una cuota muy pequeña y escala hasta $300/mes.
Con OmniHuman v1.5, no pagas nada en los meses en que no creas nada. Haz un video de 30 segundos por $7.20. Haz diez por $72. Haz cero y paga cero. Las cuentas nuevas también reciben 10 créditos gratuitos al registrarse para explorar Seedream y Seedance 1.0 Lite antes de comprar.
Consulta el desglose completo en nuestra Guía de precios de OmniHuman v1.5.
¿Listo para probar OmniHuman v1.5? Empieza a crear gratis →

¿Quieres un presentador así? Prueba OmniHuman gratis →
Paso a paso: tu primer video en minutos
- Prepara la foto. Elige un retrato bien iluminado o genera uno con Seedream.
- Prepara el audio. Grábate tú mismo o usa cualquier TTS de calidad. Recorta el silencio al inicio y al final.
- Abre el modelo. Ve a arteza.ai y selecciona OmniHuman v1.5, o accede directamente a página del modelo.
- Sube los archivos. Foto, audio y un prompt breve de la escena.
- Configura. Elige 720p o 1080p y activa el modo turbo si quieres velocidad.
- Genera. Unos minutos después, tu video estará listo.
- Revisa y descarga. Sale en MP4, listo para cualquier editor o plataforma.
Para una guía más detallada, consulta tutorial de cabeza parlante.
Casos de uso reales que merecen tu atención
Formación corporativa: videos con un presentador coherente sin necesidad de programar sesiones de grabación. Actualiza el contenido simplemente cambiando el audio. Guía completa.
E-learning: los instructores de cursos pueden publicar lecciones a escala. Los avatares mantienen la atención mejor que las diapositivas estáticas con voz en off. Guía completa.
Prospección de ventas: mensajes de video personalizados que se dirigen a los prospectos por su nombre. Guía completa.
Atención al cliente: respuestas en video a las preguntas frecuentes que resuelven dudas más rápido que los artículos de ayuda. Guía completa.
YouTube y podcasting: copresentadores de IA, segmentos explicativos y versiones en video de programas de audio. Consulta las guías YouTube y podcast.
Educación sanitaria: explicaciones para pacientes en cualquier idioma desde un rostro de confianza único. Guía completa.
Contenido multilingüe: misma foto, cambia el audio y publica diez versiones en distintos idiomas con una identidad visual coherente. Guía completa.
Consejos para mejorar la calidad del resultado
Selección de la foto
- Iluminación uniforme y suave, sin sombras duras
- De frente o con un ligero ángulo de tres cuartos
- Manos alejadas del rostro
- Fondo limpio que contraste con el sujeto
Preparación del audio
- Graba en una habitación silenciosa con reverberación mínima
- Habla a un ritmo natural e incluye pausas reales
- Normaliza los niveles para evitar saturación
- Elimina la música o el ruido ambiental antes de subir el archivo
Redacción del prompt
- Sé específico: «oficina moderna con grandes ventanales» supera a «fondo bonito»
- Nombra la iluminación: «luz clave de estudio suave» o «sol cálido de tarde»
- Indica el encuadre: «plano medio, cabeza y hombros»
- No contradigas la foto (no describas un color de cabello diferente)
Iteración
- Usa el modo turbo para pruebas
- Cambia una variable a la vez
- Guarda un archivo con los prompts que funcionaron
OmniHuman v1.5 frente a las alternativas
| Característica | OmniHuman v1.5 | HeyGen | Synthesia | D-ID |
|---|---|---|---|---|
| Input con foto personalizada | Sí | Limitado | No (avatares predefinidos) | Sí |
| Calidad de sincronización labial | Excelente | Buena | Buena | Moderada |
| Generación de gestos | Guiada por audio | Basada en plantillas | Basada en plantillas | Limitada |
| Resolución máxima | 1080p | 1080p | 1080p | 1024x1024 |
| Modelo de precios | Pago por uso | Suscripción | Suscripción | Mixto |
| Costo por video | ~$7.20 por 30 s | $24-48/mes | $30-90/mes | $5-300/mes |
| Créditos gratuitos al registrarse | 10 créditos | Prueba limitada | Prueba gratuita | Prueba limitada |
Comparativas detalladas:
Escapa de la trampa de la suscripción mensual
HeyGen, Synthesia y D-ID te cobran cada mes, incluso cuando no haces ningún video. OmniHuman v1.5 cobra $7.20 solo cuando creas.
Genera tu primer videoLimitaciones honestas
- Límites de duración. 60 s a 720p, 30 s a 1080p. El contenido más largo requiere empalme.
- Una sola persona por video. Las escenas con varias personas requieren composición.
- Solo parte superior del cuerpo. Sin animación de cuerpo completo.
- La calidad del audio importa. Mal input, mala sincronización labial.
- No es en tiempo real. Las generaciones tardan minutos, no milisegundos.
- Sin transmisión en directo. El resultado es un MP4 prerenderizado.
Preguntas frecuentes
¿Puedo usar cualquier foto?
Puedes usar cualquier foto que cumpla los requisitos de input, pero eres responsable de los derechos y permisos. Los términos de servicio de Arteza cubren los detalles legales.
¿Funciona con audio en idiomas distintos al inglés?
Sí. Funciona con cualquier idioma hablado, con mayor precisión en aquellos que tienen una representación sólida en el entrenamiento. Consulta guía multilingüe.
¿Puedo editar el resultado?
Sí. El resultado es un MP4 estándar. Recórtalo, encuádralo, compónlo: lo que admita tu editor.
¿Hay una API?
Sí. Consulta guía de API.
Empieza a crear
- Regístrate en Arteza y obtén tus 10 créditos gratuitos
- Suscríbete: el plan Creator de $25 te da 300 créditos, equivalentes a unos 6 videos de OmniHuman de treinta segundos
- Prepara una foto y un archivo de audio
- Abre OmniHuman v1.5
- Sube los archivos, configura y genera
Planes asequibles desde $5/mes. Sin mínimo. Solo $7.20 por cada video hablado y ultrarrealista de 30 segundos, cuando lo necesites.
¿Listo para probar OmniHuman v1.5? Empieza a crear gratis →
Prueba OmniHuman v1.5 - ¡Ahora mismo!
Sube tu imagen de referencia en la página de creación.
5 generaciones gratis · Sin tarjeta de crédito