Cómo crear vídeos de presentador AI con OmniHuman v1.5
Tutorial paso a paso para crear vídeos profesionales de presentador AI usando OmniHuman v1.5 en Arteza. Aprende selección de fotos, preparación de audio, redacción de indicaciones y técnicas de optimización para obtener los mejores resultados.

Tu primer vídeo de cabeza parlante con OmniHuman v1.5 toma unos diez minutos de principio a fin, y cuesta exactamente 9,60 dólares. Este tutorial te muestra cada paso, cada decisión de entrada y cada truco de calidad que hemos aprendido al generar miles de vídeos de cabeza parlante en la plataforma.
RESUMEN
- Necesitas una foto de retrato, un archivo de audio y una breve descripción de escena
- Cada generación cuesta 960 créditos (~9,60 dólares) - planes de suscripción asequibles
- Elige 720p para clips de 60 segundos o 1080p para clips de 30 segundos
- Buena foto + audio limpio + descripción específica = resultado profesional al primer intento
- Modo Turbo para iteración, modo estándar para contenido principal
Qué necesitas antes de empezar
Tres entradas, sin excepciones:
- Una foto de retrato - cabeza y hombros, bien iluminada, mínimo 512x512 píxeles
- Un archivo de audio - MP3, WAV o M4A, voz limpia, hasta 60 segundos
- Una descripción de escena - una breve descripción del fondo e iluminación
Además de una cuenta de Arteza con al menos 960 créditos. Las cuentas nuevas reciben 50 créditos gratis al registrarse, pero una cabeza parlante cuesta 960, así que necesitarás al menos un paquete Starter de 10 dólares para ejecutar tu primer vídeo.
Crea tu presentador de IA ahora
Convierte una foto + audio en un vídeo parlante realista. 9,60 dólares por vídeo, planes de suscripción asequibles.
Prueba OmniHuman gratis5 generaciones gratis · Sin tarjeta de crédito
Paso 1: Elige o crea la foto correcta
La foto es la única palanca de calidad más importante en todo el flujo de trabajo. Si le das al modelo una foto excelente, devolverá un vídeo excelente. Si le das una foto apresurarada del teléfono, la salida reflejará eso.
Qué hace que una foto de referencia sea excelente
- Iluminación uniforme. Luz natural difusa o luz de estudio suave. Sin sombras duras en la cara.
- Cara clara. Ojos abiertos, sin reflejos de gafas, sin pelo cubriendo características, sin manos cerca de la cara.
- Encuadre correcto. Cabeza y hombros visibles. La cara ocupa al menos el 30% del fotograma.
- Expresión neutral. Una cara relajada o ligeramente agradable le da al modelo la máxima flexibilidad.
- Fondo limpio. Alto contraste entre el sujeto y el fondo ayuda al modelo a aislar la identidad.
- Resolución nítida. 1024x1024 o más grande. Sin desenfoque de movimiento.
¿No tienes una foto? Genera una
Si necesitas una foto de referencia que no tengas - para un portavoz virtual, un personaje o una persona - usa Seedream para generar una. Solicita "foto profesional de perfil de [descripción], iluminación de estudio suave, fondo neutro, mirando a la cámara" y elige el resultado más limpio.
Formatos
JPEG y PNG funcionan ambos. Los fondos transparentes son aceptables. La plataforma acepta fotos de hasta varios megabytes.
Paso 2: Prepara audio limpio
Tu audio determina la sincronización de labios, la expresión facial y el patrón de gestos. Cuanto más limpio sea el audio, más tendrá de lo que trabajar el modelo.
Opciones de grabación
Grábate a ti mismo. Una sala silenciosa y un micrófono USB decente producirán audio lo suficientemente limpio para OmniHuman. Habla a un ritmo natural, con pausas naturales. No sobre-pronuncies.
Usa un servicio TTS. Cualquier herramienta de síntesis de voz de calidad funciona - ElevenLabs, Play.ht, Google, Amazon Polly. Exporta a 44.1kHz o 48kHz mono o estéreo.
Extrae de audio existente. Un segmento de podcast, un clip de seminario web o una grabación de voz en off funcionan siempre que la voz esté aislada.
Lo que debes y no debes hacer con el audio
- Debes recortar el silencio inicial y final
- Debes normalizar los niveles de audio para evitar recortes
- No debes dejar música o sonidos ambientes pesados en la mezcla
- No debes usar grabaciones de sala con mucha reverberación
- No debes exceder el límite de duración: 60s para 720p, 30s para 1080p
Paso 3: Escribe una descripción de escena que ayude
La descripción de escena describe el entorno visual alrededor de tu presentador. No describe a la persona - el modelo obtiene eso de la foto.
Estructura de buena descripción
Una descripción fuerte incluye cuatro elementos:
- Fondo - ¿dónde está la persona?
- Iluminación - ¿cómo está iluminada la escena?
- Encuadre - ¿cuán cerca está la cámara?
- Estilo - ¿alguna nota sobre el tono o acabado?
Descripciones de ejemplo que funcionan
Oficina corporativa moderna con grandes ventanas, iluminación natural suave desde la izquierda, encuadre de plano medio cabeza y hombros, estilo profesional de transmisión.
Estudio minimalista con fondo de degradado suave, iluminación de estudio uniforme, plano medio, aspecto limpio y contemporáneo.
Cómoda oficina en casa con estanterías en el fondo, luz solar dorada de la tarde, plano medio cerrado, tono natural y accesible.
Qué evitar en descripciones
- No describas a la persona (color de pelo, edad, atuendo) - la foto se encarga de eso
- No contradijas la foto (sin "fondo blanco" si la foto tiene un fondo negro, a menos que realmente quieras que el modelo lo reemplace)
- No uses frases vagas como "buena iluminación" - elige una fuente de luz específica
- No sobrecargues la descripción con más de cinco o seis detalles
Paso 4: Sube y configura
Abre arteza.ai y selecciona OmniHuman v1.5, o ve directamente a página del modelo.
Orden de carga
- Foto de referencia - arrastra el retrato al espacio de imagen
- Archivo de audio - suelta el archivo de voz al espacio de audio
- Descripción de escena - pega tu descripción de escena
Configura los ajustes
- Resolución: 720p para borradores o clips más largos que 30s, 1080p para renders finales profesionales
- Modo Turbo: activado para iteración, desactivado para calidad final
- Revisar costo de crédito: la interfaz confirmará 960 créditos antes de que generes
Paso 5: Genera y revisa
Haz clic en generar. El modo estándar toma varios minutos. El modo Turbo es más rápido. Recibirás una notificación cuando el vídeo esté listo.
Revisión de la salida
Reproduce el vídeo a tamaño completo y verifica estas cuatro cosas:
- Sincronización de labios - ¿coinciden las formas de la boca con los fonemas?
- Identidad - ¿se parece la cara a la referencia durante todo el vídeo?
- Naturalismo de gestos - ¿el movimiento se siente orgánico, no robótico?
- Consistencia del fondo - ¿la escena coincide con tu descripción?
Si algo se siente mal, la solución casi siempre está en las entradas, no en un reintentoago. Cambia la foto, limpia el audio o ajusta la descripción.
¿Listo para probar OmniHuman v1.5? Comienza a crear gratis →

¿Quieres un presentador como este? Prueba OmniHuman gratis →
Consejos avanzados de flujos de trabajo de producción real
Usa Turbo para exploración, estándar para finales
El modo Turbo sigue costando 960 créditos por generación, pero recorta la espera. Úsalo para probar diferentes descripciones o tomas de audio rápidamente, luego renderiza la versión final en modo estándar.
Coincide la emoción del audio con la expresión de referencia
Si tu foto muestra una cara neutral pero tu audio es altamente animado, el modelo generará mucho movimiento. Si el audio es tranquilo y la foto está sonriendo, espera variación sutil. Hazlos coincidir para resultados predecibles.
Divide contenido largo en segmentos
¿Necesitas un vídeo de 90 segundos? Divide el audio en dos segmentos (por ejemplo, 45s cada uno), genera dos clips de 720p y únelos en cualquier editor de vídeo. La identidad se mantiene consistente porque estás usando la misma foto de referencia.
Prepara varias fotos de la misma persona
Tener tres o cuatro fotos de referencia de la misma persona - diferentes atuendos, diferente iluminación, diferentes expresiones - te permite hacer coincidir la foto con el tono del contenido. Una anécdota cálida obtiene una foto más cálida; una actualización corporativa obtiene la foto de perfil.
Mantén una biblioteca de descripciones
Guarda descripciones de escena que funcionaron. "Degradado de estudio minimalista" o "luz de ventana de oficina moderna" pueden reutilizarse en proyectos para consistencia visual.
Errores comunes y cómo corregirlos
La sincronización de labios se siente ligeramente desajustada
- Verifica la calidad del audio. El ruido, artefactos de compresión o baja velocidad de bits dañan la extracción de fonemas
- Verifica la duración. Los clips exactamente en el límite pueden cortarse en el último fotograma - apunta a un segundo menos
- Intenta una grabación más limpia o re-exporta con mayor velocidad de bits
La cara se ve "plástica" o demasiado suave
- Usa una foto de mayor resolución. La entrada sub-512px produce salida suave
- Ajusta la iluminación de la descripción a "natural" en lugar de "estudio" para más textura
Los gestos se ven demasiado sutiles
- Usa audio más expresivo. El habla monótona produce variación mínima de gestos
- Selecciona una foto con postura ligeramente abierta en lugar de encuadre frontal rígido
El fondo no coincide con la descripción
- Sé más específico. "Oficina" es vago; "oficina moderna con una estantería detrás del sujeto y una gran ventana a la izquierda" es procesable
- Haz coincidir el contexto de la foto. El modelo pondera el fondo de la foto como referencia
Cálculo de costos para diferentes proyectos
Cada vídeo de OmniHuman v1.5 cuesta 960 créditos (~9,60 dólares). Así es lo que se ve en la práctica:
| Proyecto | Vídeos necesarios | Costo total |
|---|---|---|
| Un solo post de LinkedIn | 1 | 9,60 dólares |
| Serie de bienvenida de cinco vídeos | 5 | 48 dólares |
| Curso de diez lecciones | 10 | 96 dólares |
| Actualizaciones semanales durante un año | 52 | 499,20 dólares |
Compáralo con HeyGen's 24-48 dólares por mes (incluso en meses en los que no creas nada) o Synthesia's 30-90 dólares por mes. Con volúmenes bajos a moderados, OmniHuman te ahorra cientos por año. Consulta desglose de precios completo para cada nivel.
Paga por vídeo, no por mes
Cada cabeza parlante cuesta 9,60 dólares - planes de suscripción asequibles para cancelar, sin mínimo mensual. Los créditos mensuales se renuevan cada ciclo de facturación. Los créditos de recarga nunca caducan.
Genera tu primer vídeoLista de verificación de tu primer vídeo
- Foto de retrato, 1024x1024 o más grande, bien iluminada, expresión neutral
- Archivo de audio limpio, menos de 60 segundos, sin música ni reverberación
- Descripción de escena con fondo, iluminación, encuadre, estilo
- Cuenta de Arteza con al menos 960 créditos
- Elección de resolución (720p o 1080p)
- Decisión del modo Turbo
- Abre OmniHuman v1.5 y genera
Una vez que hayas publicado tu primera cabeza parlante, explora guía técnica de sincronización de labios, guía de flujo de trabajo multilingüe y tutoriales específicos de casos de uso como presentadores de noticias y capacitación corporativa.
¿Listo para probar OmniHuman v1.5? Comienza a crear gratis →
Try OmniHuman v1.5 - Right Now
Upload your reference image on the create page.
5 free generations · No credit card needed