Cómo crear videos de cabeza parlante con IA usando OmniHuman v1.5
Un tutorial paso a paso para crear videos profesionales de cabeza parlante con IA usando OmniHuman v1.5 en Arteza. Aprende a seleccionar fotos, preparar audio, escribir prompts y aplicar técnicas de optimización para obtener los mejores resultados.

Tu primer vídeo de cabeza parlante con OmniHuman v1.5 tarda unos diez minutos de principio a fin, y cuesta exactamente $0,30-$7,20. Este tutorial te muestra cada paso, cada decisión de entrada y cada truco de calidad que hemos aprendido al generar miles de vídeos de cabeza parlante en la plataforma.
Resumen rápido
- Necesitas una foto de retrato, un archivo de audio y un breve texto de escena
- Un vídeo de 30 segundos cuesta 72 créditos (~$7.20), con planes desde $5 al mes
- Elige 720p para clips de 60 segundos o 1080p para clips de 30 segundos
- Buena foto + audio limpio + indicación específica = resultado profesional desde el primer intento
- Modo turbo para iterar, modo estándar para el contenido definitivo
Lo que necesitas antes de empezar
Tres elementos de entrada, sin excepciones:
- Una foto de retrato: cabeza y hombros, bien iluminada, mínimo 512x512 píxeles
- Un archivo de audio: MP3, WAV o M4A, voz clara, hasta 60 segundos
- Un texto de escena: una breve descripción del fondo y la iluminación
Además, necesitas una cuenta de Arteza con suficientes créditos para tu clip: 2,4 créditos por segundo de audio, es decir, 46 para un vídeo de 30 segundos. Las cuentas nuevas reciben 10 créditos gratis al registrarse, suficientes para un clip de prueba corto, y el plan Starter de $5 cubre un mes de clips de duración completa.
Crea tu presentador de IA ahora
Convierte una foto y un audio en un vídeo parlante realista. $7.20 por vídeo de 30 segundos, con planes desde $5 al mes.
Prueba OmniHuman gratis5 generaciones gratis · Sin tarjeta de crédito
Paso 1: elige o crea la foto adecuada
La foto es el mayor factor de calidad en todo el proceso. Dale al modelo una gran foto y te devolverá un gran vídeo. Dale una instantánea apresurada con el móvil y el resultado lo reflejará.
Qué hace que una foto de referencia sea excelente
- Iluminación uniforme. Luz natural difusa o luz de estudio suave. Sin sombras duras sobre el rostro.
- Cara despejada. Ojos abiertos, sin reflejos en las gafas, sin cabello tapando rasgos, sin manos cerca del rostro.
- Encuadre correcto. Cabeza y hombros visibles. El rostro ocupa al menos el 30% del fotograma.
- Expresión neutra. Un rostro relajado o levemente amable le da al modelo mayor flexibilidad.
- Fondo limpio. Un alto contraste entre el sujeto y el fondo ayuda al modelo a aislar la identidad.
- Resolución nítida. 1024x1024 o mayor. Sin desenfoque de movimiento.
¿No tienes foto? Genera una
Si necesitas una foto de referencia que no tienes, ya sea para un portavoz virtual, una persona o un personaje, usa Seedream para generarla. Usa una indicación como "foto de perfil profesional de [descripción], iluminación de estudio suave, fondo neutro, mirando a cámara" y elige el resultado más limpio.
Formatos
JPEG y PNG funcionan ambos. Los fondos transparentes son aceptables. La plataforma admite fotos de varios megabytes.
Paso 2: prepara un audio limpio
El audio determina la sincronización labial, la expresión facial y el patrón de gestos. Cuanto más limpio sea el audio, más tiene el modelo con qué trabajar.
Opciones de grabación
Grábate tú mismo. Una habitación silenciosa y un micrófono USB decente producen un audio suficientemente limpio para OmniHuman. Habla a un ritmo natural, con pausas naturales. No sobreartícules.
Usa un servicio de síntesis de voz. Cualquier herramienta de texto a voz de calidad funciona: ElevenLabs, Play.ht, Google, Amazon Polly. Exporta a 44,1 kHz o 48 kHz en mono o estéreo.
Extrae de un audio existente. Un segmento de pódcast, un clip de webinar o una grabación de locución funcionan siempre que la voz esté aislada.
Qué hacer y qué evitar con el audio
- Sí: recorta los silencios al inicio y al final
- Sí: normaliza los niveles de audio para evitar saturación
- No: dejes música o sonidos ambientales fuertes en la mezcla
- No: uses grabaciones con mucha reverberación
- No: superes el límite de duración: 60 s para 720p, 30 s para 1080p
Paso 3: escribe un texto de escena que ayude
El texto de escena describe el entorno visual alrededor de tu presentador. No describe a la persona: el modelo obtiene esa información de la foto.
Estructura de una buena indicación
Una indicación sólida incluye cuatro elementos:
- Fondo: ¿dónde está la persona?
- Iluminación: ¿cómo está iluminada la escena?
- Encuadre: ¿qué tan cerca está la cámara?
- Estilo: ¿alguna nota sobre el tono o el acabado?
Ejemplos de indicaciones que funcionan
Oficina corporativa moderna con grandes ventanales, luz natural suave proveniente de la izquierda, encuadre medio de cabeza y hombros, estilo de transmisión profesional.
Estudio minimalista con un fondo degradado suave, iluminación de estudio uniforme, plano medio, aspecto limpio y contemporáneo.
Oficina en casa acogedora con estantes de libros al fondo, luz dorada de tarde, plano medio, tono natural y cercano.
Qué evitar en las indicaciones
- No describas a la persona (color de pelo, edad, ropa): la foto se encarga de eso
- No contradigas la foto (no escribas "fondo blanco" si la foto tiene fondo negro, a menos que realmente quieras que el modelo lo reemplace)
- No uses frases vagas como "buena iluminación": elige una fuente de luz específica
- No sobrecargues la indicación con más de cinco o seis detalles
Paso 4: sube los archivos y configura
Abre arteza.ai y selecciona OmniHuman v1.5, o ve directamente a página del modelo.
Orden de subida
- Foto de referencia: arrastra el retrato al espacio de imagen
- Archivo de audio: suelta el archivo de voz en el espacio de audio
- Texto de escena: pega la descripción de tu escena
Configura los ajustes
- Resolución: 720p para borradores o clips de más de 30 s, 1080p para renders finales profesionales
- Modo turbo: activado para iterar, desactivado para calidad final
- Revisa el costo en créditos: la interfaz confirmará el costo exacto antes de que generes
Paso 5: genera y revisa
Haz clic en generar. El modo estándar tarda varios minutos. El modo turbo es más rápido. Recibirás una notificación cuando el vídeo esté listo.
Revisión del resultado
Reproduce el vídeo a pantalla completa y comprueba estos cuatro aspectos:
- Sincronización labial: ¿las formas bucales coinciden con los fonemas?
- Identidad: ¿el rostro se parece al de referencia a lo largo de todo el vídeo?
- Naturalidad de los gestos: ¿el movimiento se siente orgánico y no robótico?
- Consistencia del fondo: ¿la escena coincide con tu indicación?
Si algo no cuadra, la solución casi siempre está en los datos de entrada, no en volver a generar. Cambia la foto, limpia el audio o ajusta la indicación.
¿Listo para probar OmniHuman v1.5? Empieza a crear gratis →

¿Quieres un presentador como este? Prueba OmniHuman gratis →
Consejos avanzados de flujos de trabajo reales
Usa turbo para explorar, estándar para los definitivos
El modo turbo cuesta lo mismo que el modo estándar para el mismo audio, pero reduce la espera. Úsalo para probar distintas indicaciones o tomas de audio rápidamente y luego renderiza la versión final en modo estándar.
Ajusta la emoción del audio a la expresión de la foto de referencia
Si tu foto muestra un rostro neutro pero tu audio es muy animado, el modelo generará mucho movimiento. Si el audio es tranquilo y la foto muestra una sonrisa, espera variaciones sutiles. Hacer que coincidan produce resultados más predecibles.
Divide el contenido largo en segmentos
¿Necesitas un vídeo de 90 segundos? Divide el audio en dos segmentos (por ejemplo, 45 s cada uno), genera dos clips en 720p y únelos en cualquier editor de vídeo. La identidad se mantiene consistente porque usas la misma foto de referencia.
Prepara varias fotos de la misma persona
Contar con tres o cuatro fotos de referencia de la misma persona, con diferentes atuendos, iluminaciones y expresiones, te permite adaptar la foto al tono del contenido. Una anécdota cálida recibe una foto más cálida; una actualización corporativa recibe la foto de perfil.
Mantén una biblioteca de indicaciones
Guarda las indicaciones de escena que funcionaron. "Degradado de estudio minimalista" o "luz de ventana en oficina moderna" pueden reutilizarse en distintos proyectos para mantener consistencia visual.
Errores comunes y cómo corregirlos
La sincronización labial se siente ligeramente desfasada
- Comprueba la calidad del audio. El ruido, los artefactos de compresión o una tasa de bits baja perjudican la extracción de fonemas
- Comprueba la duración. Los clips que llegan exactamente al límite pueden cortarse en el último fotograma: apunta a un segundo menos
- Intenta una grabación más limpia o vuelve a exportar a mayor tasa de bits
El rostro se ve "plastificado" o demasiado suave
- Usa una foto de mayor resolución. Una entrada por debajo de 512 px produce resultados borrosos
- Ajusta la iluminación en la indicación a "natural" en lugar de "estudio" para obtener más textura
Los gestos se ven demasiado sutiles
- Usa un audio más expresivo. Un discurso monótono produce variaciones de gesto mínimas
- Elige una foto con una postura ligeramente abierta en lugar de un encuadre frontal rígido
El fondo no coincide con la indicación
- Sé más específico. "Oficina" es vago; "oficina moderna con una estantería detrás del sujeto y una gran ventana a la izquierda" es accionable
- Adapta el contexto de la foto. El modelo toma el fondo de la foto como referencia
Cálculo de costos para distintos proyectos
Cada vídeo de OmniHuman v1.5 cuesta 3-72 créditos ($0,30-$7,20). Así se ve en la práctica:
| Proyecto | Vídeos necesarios | Costo total |
|---|---|---|
| Publicación individual en LinkedIn | 1 | $7.20 |
| Serie de bienvenida de cinco vídeos | 5 | $36 |
| Curso de diez lecciones | 10 | $72 |
| Actualizaciones semanales durante un año | 52 | $499.20 |
Compara eso con los $24-$48 al mes de HeyGen (incluso en los meses que no creas nada) o los $30-$90 al mes de Synthesia. En volúmenes bajos y moderados, OmniHuman ahorra cientos de dólares al año. Consulta desglose completo de precios para ver cada nivel.
Paga por vídeo, no por mes
Una cabeza parlante de 30 segundos cuesta $7.20, con planes desde $5 al mes sin contrato anual. Los créditos mensuales se renuevan en cada ciclo de facturación. Los créditos de recarga nunca caducan.
Genera tu primer vídeoLista de verificación para tu primer vídeo
- Foto de retrato, 1024x1024 o mayor, bien iluminada, expresión neutra
- Archivo de audio limpio, menos de 60 segundos, sin música ni reverberación
- Texto de escena con fondo, iluminación, encuadre y estilo
- Cuenta de Arteza con al menos 72 créditos
- Elección de resolución (720p o 1080p)
- Decisión sobre el modo turbo
- Abre OmniHuman v1.5 y genera
Una vez que hayas publicado tu primer vídeo de cabeza parlante, explora guía técnica de sincronización de labios, guía de flujo de trabajo multilingüe y tutoriales específicos por caso de uso como presentadores de noticias y formación corporativa.
¿Listo para probar OmniHuman v1.5? Empieza a crear gratis →
Prueba OmniHuman v1.5 - ¡Ahora mismo!
Sube tu imagen de referencia en la página de creación.
5 generaciones gratis · Sin tarjeta de crédito