Comment créer des vidéos de tête parlante IA avec OmniHuman v1.5
Un tutoriel pas à pas pour créer des vidéos de tête parlante IA professionnelles avec OmniHuman v1.5 sur Arteza. Apprenez à sélectionner vos photos, préparer l'audio, rédiger des prompts et optimiser vos paramètres pour obtenir les meilleurs résultats.

Votre première vidéo talking head OmniHuman v1.5 prend environ dix minutes de bout en bout, et elle coûte exactement $0,30-$7,20. Ce tutoriel vous présente chaque étape, chaque décision de paramétrage et toutes les astuces qualité que nous avons apprises en générant des milliers de vidéos talking head sur la plateforme.
En bref
- Il vous faut une photo portrait, un fichier audio et une courte description de scène
- Une vidéo de 30 secondes coûte 72 crédits (~$7.20), sur des formules à partir de $5 par mois
- Choisissez la 720p pour les clips de 60 secondes ou la 1080p pour les clips de 30 secondes
- Bonne photo + audio propre + description précise = résultat professionnel dès le premier essai
- Le mode Turbo pour l'itération, le mode standard pour le contenu final
Ce dont vous avez besoin avant de commencer
Trois éléments, sans exception :
- Une photo portrait - tête et épaules, bien éclairée, minimum 512x512 pixels
- Un fichier audio - MP3, WAV ou M4A, voix claire, jusqu'à 60 secondes
- Une description de scène - une courte description de l'arrière-plan et de l'éclairage
Plus un compte Arteza avec suffisamment de crédits pour votre clip : 2,4 crédits par seconde d'audio, soit 46 pour une vidéo de 30 secondes. Les nouveaux comptes reçoivent 10 crédits offerts à l'inscription, ce qui couvre un court clip de test, et la formule Starter à $5 couvre un mois de clips pleine durée.
Créez votre présentateur IA maintenant
Transformez une photo et un audio en une vidéo parlante réaliste. $7.20 par vidéo de 30 secondes, sur des formules à partir de $5 par mois.
Essayer OmniHuman gratuitement5 générations gratuites · Aucune carte de crédit requise
Étape 1 : choisir ou créer la bonne photo
La photo est le plus grand levier de qualité de tout le processus. Donnez une excellente photo au modèle et il vous renverra une excellente vidéo. Donnez-lui un cliché pris à la va-vite et le résultat s'en ressentira.
Ce qui fait une bonne photo de référence
- Éclairage uniforme. Lumière naturelle diffuse ou lumière studio douce. Pas d'ombres dures sur le visage.
- Visage net. Yeux ouverts, pas de reflets sur les lunettes, pas de mèches couvrant les traits, pas de mains près du visage.
- Cadrage adapté. Tête et épaules visibles. Le visage occupe au moins 30 % du cadre.
- Expression neutre. Un visage détendu ou légèrement agréable offre au modèle le plus de flexibilité.
- Arrière-plan épuré. Un fort contraste entre le sujet et l'arrière-plan aide le modèle à isoler l'identité.
- Haute résolution. 1024x1024 ou plus. Pas de flou de bougé.
Vous n'avez pas de photo ? Générez-en une
Si vous avez besoin d'une photo de référence que vous ne possédez pas encore, pour un porte-parole virtuel, un persona ou un personnage, utilisez Seedream pour en générer une. Demandez un "portrait professionnel de [description], éclairage studio doux, arrière-plan neutre, regard caméra" et choisissez le résultat le plus propre.
Formats
JPEG et PNG fonctionnent tous les deux. Les arrière-plans transparents sont acceptés. La plateforme accepte des photos de plusieurs mégaoctets.
Étape 2 : préparer un audio propre
Votre audio détermine la synchronisation labiale, l'expression faciale et le schéma de gestuelle. Plus l'audio est propre, plus le modèle dispose de matière pour travailler.
Options d'enregistrement
Enregistrez vous-même. Une pièce calme et un bon microphone USB produiront un audio suffisamment propre pour OmniHuman. Parlez à un rythme naturel, avec des pauses naturelles. N'articulez pas à l'excès.
Utilisez un service TTS. N'importe quel outil de synthèse vocale de qualité convient : ElevenLabs, Play.ht, Google, Amazon Polly. Exportez en 44,1 kHz ou 48 kHz, mono ou stéréo.
Extrayez depuis un audio existant. Un segment de podcast, un extrait de webinaire ou un enregistrement de voix off fonctionnent, à condition que la voix soit isolée.
Ce qu'il faut faire et ne pas faire avec l'audio
- Faites couper le silence en début et en fin
- Faites normaliser les niveaux audio pour éviter l'écrêtage
- Ne laissez pas de musique ou de sons ambiants forts dans le mixage
- N'utilisez pas d'enregistrements en salle avec beaucoup de réverbération
- Ne dépassez pas la durée maximale : 60 s pour la 720p, 30 s pour la 1080p
Étape 3 : rédiger une description de scène efficace
La description de scène décrit l'environnement visuel autour de votre présentateur. Elle ne décrit pas la personne : le modèle obtient cette information depuis la photo.
Structure d'une bonne description
Une description efficace comprend quatre éléments :
- Arrière-plan - où se trouve la personne ?
- Éclairage - comment la scène est-elle éclairée ?
- Cadrage - à quelle distance est la caméra ?
- Style - des notes sur le ton ou la finition ?
Exemples de descriptions efficaces
Bureau d'entreprise moderne avec de grandes fenêtres, lumière naturelle douce venant de la gauche, plan moyen serré sur la tête et les épaules, style diffusion professionnelle.
Studio minimaliste avec un fond dégradé doux, éclairage studio uniforme, plan moyen, look épuré et contemporain.
Bureau à domicile chaleureux avec des bibliothèques en arrière-plan, lumière dorée de fin d'après-midi, plan moyen serré, ton naturel et accessible.
Ce qu'il faut éviter dans les descriptions
- Ne décrivez pas la personne (couleur des cheveux, âge, tenue) : la photo s'en charge
- Ne contredisez pas la photo (pas de "fond blanc" si la photo a un fond noir, sauf si vous voulez vraiment que le modèle le remplace)
- Évitez les formulations vagues comme "bon éclairage" : choisissez une source lumineuse précise
- Ne surchargez pas la description avec plus de cinq ou six détails
Étape 4 : importer et configurer
Ouvrez arteza.ai et sélectionnez OmniHuman v1.5, ou rendez-vous directement sur page du modèle.
Ordre d'importation
- Photo de référence - faites glisser le portrait dans le champ image
- Fichier audio - déposez le fichier vocal dans le champ audio
- Description de scène - collez votre description de scène
Configurer les paramètres
- Résolution : 720p pour les brouillons ou les clips de plus de 30 s, 1080p pour les rendus finaux professionnels
- Mode Turbo : activé pour l'itération, désactivé pour la qualité finale
- Vérifiez le coût en crédits : l'interface confirmera le coût exact avant la génération
Étape 5 : générer et réviser
Cliquez sur Générer. Le mode standard prend plusieurs minutes. Le mode Turbo est plus rapide. Vous recevrez une notification lorsque la vidéo est prête.
Réviser le résultat
Visionnez la vidéo en plein écran et vérifiez ces quatre points :
- Synchronisation labiale - les formes de la bouche correspondent-elles aux phonèmes ?
- Identité - le visage ressemble-t-il à la référence tout au long de la vidéo ?
- Naturalité des gestes - le mouvement semble-t-il organique, pas robotique ?
- Cohérence de l'arrière-plan - la scène correspond-elle à votre description ?
Si l'un de ces points semble incorrect, la correction se trouve presque toujours dans les entrées, pas dans un nouveau tirage. Remplacez la photo, nettoyez l'audio ou affinez la description.
Prêt à essayer OmniHuman v1.5 ? Commencer à créer gratuitement →

Vous voulez un présentateur comme celui-ci ? Essayer OmniHuman gratuitement →
Conseils avancés issus de vrais workflows de production
Turbo pour l'exploration, standard pour les finaux
Le mode Turbo coûte autant que le mode standard pour le même audio, mais il réduit le temps d'attente. Utilisez-le pour tester rapidement différentes descriptions ou différentes prises audio, puis effectuez le rendu final en mode standard.
Associez l'émotion de l'audio à l'expression de la photo de référence
Si votre photo montre un visage neutre mais que votre audio est très expressif, le modèle générera beaucoup de mouvement. Si l'audio est calme et que la photo est souriante, attendez-vous à des variations subtiles. Faites-les correspondre pour des résultats prévisibles.
Découpez le contenu long en segments
Vous avez besoin d'une vidéo de 90 secondes ? Divisez l'audio en deux segments (par exemple, 45 s chacun), générez deux clips en 720p et assemblez-les dans n'importe quel éditeur vidéo. L'identité reste cohérente car vous utilisez la même photo de référence.
Préparez plusieurs photos de la même personne
Disposer de trois ou quatre photos de référence de la même personne, avec des tenues, des éclairages et des expressions différentes, vous permet d'adapter la photo au ton du contenu. Une anecdote chaleureuse appelle une photo plus chaleureuse ; une mise à jour corporate appelle la photo de profil.
Constituez une bibliothèque de descriptions
Sauvegardez les descriptions de scène qui ont fonctionné. "Dégradé studio minimaliste" ou "lumière fenêtre bureau moderne" peuvent être réutilisés d'un projet à l'autre pour une cohérence visuelle.
Erreurs courantes et comment les corriger
La synchronisation labiale est légèrement décalée
- Vérifiez la qualité audio. Le bruit, les artefacts de compression ou un faible débit nuisent à l'extraction des phonèmes
- Vérifiez la durée. Les clips à exactement la limite maximale peuvent être coupés sur la dernière image : visez une seconde en dessous
- Essayez un enregistrement plus propre ou ré-exportez à un débit plus élevé
Le visage paraît "plastique" ou trop lisse
- Utilisez une photo de plus haute résolution. Une entrée inférieure à 512 px produit un résultat flou
- Ajustez l'éclairage dans la description en optant pour "naturel" plutôt que "studio" pour plus de texture
Les gestes semblent trop subtils
- Utilisez un audio plus expressif. Une voix monotone produit très peu de variation gestuelle
- Choisissez une photo avec une posture légèrement ouverte plutôt qu'un cadrage frontal rigide
L'arrière-plan ne correspond pas à la description
- Soyez plus précis. "Bureau" est vague ; "bureau moderne avec une bibliothèque derrière le sujet et une grande fenêtre sur la gauche" est exploitable
- Tenez compte du contexte de la photo. Le modèle utilise l'arrière-plan de la photo comme référence
Calcul du coût pour différents projets
Chaque vidéo OmniHuman v1.5 coûte 3-72 crédits ($0,30-$7,20). Voici ce que cela représente en pratique :
| Projet | Vidéos nécessaires | Coût total |
|---|---|---|
| Un seul post LinkedIn | 1 | $7.20 |
| Série de bienvenue en cinq vidéos | 5 | $36 |
| Cours de dix leçons | 10 | $72 |
| Mises à jour hebdomadaires pendant un an | 52 | $499.20 |
Comparez cela aux $24-$48 par mois de HeyGen (même les mois où vous ne créez rien) ou aux $30-$90 par mois de Synthesia. À faible et moyen volume, OmniHuman fait économiser des centaines de dollars par an. Consultez détail complet des tarifs pour chaque niveau de formule.
Payez par vidéo, pas par mois
Une vidéo talking head de 30 secondes coûte $7.20, sur des formules à partir de $5 par mois sans engagement annuel. Les crédits mensuels se renouvellent à chaque cycle de facturation. Les crédits supplémentaires n'expirent jamais.
Générer votre première vidéoListe de contrôle pour votre première vidéo
- Photo portrait, 1024x1024 ou plus, bien éclairée, expression neutre
- Fichier audio propre, moins de 60 secondes, sans musique ni réverbération
- Description de scène avec arrière-plan, éclairage, cadrage et style
- Compte Arteza avec au moins 72 crédits
- Choix de la résolution (720p ou 1080p)
- Décision sur le mode Turbo
- Ouvrir OmniHuman v1.5 et générer
Une fois votre première vidéo talking head publiée, explorez guide technique de synchronisation labiale, guide de flux de travail multilingue et les tutoriels par cas d'usage comme présentateurs de journaux télévisés et formation en entreprise.
Prêt à essayer OmniHuman v1.5 ? Commencer à créer gratuitement →
Essayez OmniHuman v1.5 - Maintenant
Téléchargez votre image de référence sur la page de création.
5 générations gratuites · Aucune carte de crédit requise