Comment créer des vidéos de personnages parlants avec OmniHuman v1.5
Un tutoriel étape par étape pour créer des vidéos professionnelles de personnages parlants avec OmniHuman v1.5 sur Arteza. Apprenez la sélection de photos, la préparation audio, la rédaction de prompts et les techniques d'optimisation pour de meilleurs résultats.

Votre première vidéo talking head avec OmniHuman v1.5 prend environ dix minutes de bout en bout, et coûte exactement 9,60 $. Ce tutoriel vous présente chaque étape, chaque décision de paramétrage et chaque astuce qualité que nous avons apprise en générant des milliers de vidéos talking head sur la plateforme.
Résumé rapide
- Il vous faut une photo portrait, un fichier audio et un court prompt de scène
- Chaque génération coûte 960 crédits (~9,60 $), avec des formules d'abonnement abordables
- Choisissez la 720p pour les clips de 60 secondes ou la 1080p pour les clips de 30 secondes
- Bonne photo + audio propre + prompt précis = résultat professionnel dès le premier essai
- Mode Turbo pour l'itération, mode standard pour le contenu final
Ce qu'il vous faut avant de commencer
Trois éléments obligatoires, sans exception :
- Une photo portrait : tête et épaules, bien éclairée, minimum 512x512 pixels
- Un fichier audio : MP3, WAV ou M4A, voix claire, jusqu'à 60 secondes
- Un prompt de scène : une courte description de l'arrière-plan et de l'éclairage
Il vous faut également un compte Arteza avec au moins 960 crédits. Les nouveaux comptes reçoivent 50 crédits gratuits à l'inscription, mais une vidéo talking head en coûte 960 : vous aurez donc besoin d'au moins un pack Starter à 10 $ pour lancer votre première vidéo.
Créez votre présentateur IA maintenant
Transformez une photo et un audio en vidéo parlante ultra-réaliste. 9,60 $ par vidéo, formules d'abonnement abordables.
Essayer OmniHuman gratuitement5 générations gratuites · Aucune carte de crédit requise
Étape 1 : Choisissez ou créez la bonne photo
La photo est le levier qualité le plus important de tout le processus. Fournissez une excellente photo au modèle et il vous rendra une excellente vidéo. Fournissez-lui un selfie pris à la va-vite et le résultat s'en ressentira.
Qu'est-ce qui fait une bonne photo de référence ?
- Un éclairage uniforme. Lumière naturelle diffuse ou éclairage studio doux. Pas d'ombres marquées sur le visage.
- Un visage net. Yeux ouverts, pas de reflets sur les lunettes, pas de cheveux couvrant les traits, pas de mains près du visage.
- Un cadrage adapté. Tête et épaules visibles. Le visage occupe au moins 30 % du cadre.
- Une expression neutre. Un visage détendu ou légèrement souriant laisse le plus de liberté au modèle.
- Un arrière-plan épuré. Un fort contraste entre le sujet et l'arrière-plan aide le modèle à isoler l'identité.
- Une résolution nette. 1024x1024 ou plus. Pas de flou de mouvement.
Pas de photo ? Générez-en une
Si vous avez besoin d'une photo de référence que vous ne possédez pas encore, pour un porte-parole virtuel, un persona ou un personnage, utilisez Seedream pour en générer une. Rédigez un prompt du type « portrait professionnel de [description], éclairage studio doux, fond neutre, regard caméra » et choisissez le résultat le plus soigné.
Formats acceptés
JPEG et PNG fonctionnent tous les deux. Les fonds transparents sont acceptés. La plateforme accepte des photos allant jusqu'à plusieurs mégaoctets.
Étape 2 : Préparez un audio propre
Votre audio détermine la synchronisation labiale, l'expression du visage et les gestes. Plus l'audio est propre, plus le modèle dispose d'informations pour travailler.
Options d'enregistrement
Enregistrez vous-même. Une pièce silencieuse et un microphone USB correct produiront un audio suffisamment propre pour OmniHuman. Parlez à un rythme naturel, avec des pauses naturelles. N'articulez pas de manière excessive.
Utilisez un service TTS. Tout outil de synthèse vocale de qualité convient : ElevenLabs, Play.ht, Google, Amazon Polly. Exportez en 44,1 kHz ou 48 kHz, mono ou stéréo.
Extrayez d'un audio existant. Un extrait de podcast, un clip de webinaire ou un enregistrement de voix off fonctionnent tous, à condition que la voix soit isolée.
À faire et à éviter avec l'audio
- Faites couper les silences en début et en fin de fichier
- Faites normaliser les niveaux audio pour éviter l'écrêtage
- Évitez de laisser de la musique ou des bruits ambiants forts dans le mix
- Évitez les enregistrements dans des pièces très réverbérantes
- Évitez de dépasser la durée maximale : 60 s en 720p, 30 s en 1080p
Étape 3 : Rédigez un prompt de scène efficace
Le prompt de scène décrit l'environnement visuel autour de votre présentateur. Il ne décrit pas la personne : le modèle obtient cette information depuis la photo.
Structure d'un bon prompt
Un prompt solide comprend quatre éléments :
- L'arrière-plan : où se trouve la personne ?
- L'éclairage : comment la scène est-elle éclairée ?
- Le cadrage : à quelle distance se trouve la caméra ?
- Le style : des notes sur le ton ou la finition ?
Exemples de prompts efficaces
Bureau d'entreprise moderne avec de grandes fenêtres, lumière naturelle douce venant de la gauche, cadrage mi-close tête et épaules, style diffusion professionnelle.
Studio minimaliste avec un fond dégradé doux, éclairage studio uniforme, plan moyen, aspect propre et contemporain.
Bureau à domicile chaleureux avec des étagères en arrière-plan, lumière dorée de fin d'après-midi, cadrage mi-close, ton naturel et accessible.
Ce qu'il faut éviter dans les prompts
- Ne décrivez pas la personne (couleur des cheveux, âge, tenue) : la photo s'en charge
- Ne contredisez pas la photo (pas de « fond blanc » si la photo a un fond noir, sauf si vous souhaitez vraiment que le modèle le remplace)
- Évitez les formules vagues comme « bonne lumière » : choisissez une source lumineuse précise
- Ne surchargez pas le prompt avec plus de cinq ou six détails
Étape 4 : Importez et configurez
Ouvrez arteza.ai et sélectionnez OmniHuman v1.5, ou accédez directement à page du modèle.
Ordre d'import
- Photo de référence : faites glisser le portrait dans l'emplacement image
- Fichier audio : déposez le fichier vocal dans l'emplacement audio
- Prompt de scène : collez la description de votre scène
Configurez les paramètres
- Résolution : 720p pour les brouillons ou les clips de plus de 30 s, 1080p pour les rendus finaux professionnels
- Mode Turbo : activé pour l'itération, désactivé pour la qualité finale
- Vérifiez le coût en crédits : l'interface confirme 960 crédits avant la génération
Étape 5 : Générez et vérifiez
Cliquez sur Générer. Le mode standard prend plusieurs minutes. Le mode Turbo est plus rapide. Vous recevrez une notification lorsque la vidéo sera prête.
Vérification du résultat
Lisez la vidéo en plein écran et vérifiez ces quatre points :
- Synchronisation labiale : les formes de la bouche correspondent-elles aux phonèmes ?
- Identité : le visage ressemble-t-il à la référence tout au long de la vidéo ?
- Naturel des gestes : les mouvements semblent-ils organiques, pas robotiques ?
- Cohérence de l'arrière-plan : la scène correspond-elle à votre prompt ?
Si l'un de ces aspects vous semble incorrect, la solution se trouve presque toujours dans les fichiers d'entrée, pas dans une nouvelle génération. Changez la photo, nettoyez l'audio ou affinez le prompt.
Prêt à essayer OmniHuman v1.5 ? Commencer à créer gratuitement →

Vous voulez un présentateur comme celui-ci ? Essayer OmniHuman gratuitement →
Conseils avancés issus de vrais flux de production
Utilisez le mode Turbo pour explorer, le mode Standard pour les versions finales
Le mode Turbo coûte toujours 960 crédits par génération, mais il réduit le temps d'attente. Utilisez-le pour tester rapidement différents prompts ou prises audio, puis rendez la version finale en mode standard.
Faites correspondre l'émotion de l'audio à l'expression de la photo
Si votre photo présente un visage neutre mais que votre audio est très animé, le modèle générera beaucoup de mouvements. Si l'audio est calme et la photo souriante, attendez-vous à des variations subtiles. Faites-les correspondre pour des résultats prévisibles.
Divisez les contenus longs en segments
Besoin d'une vidéo de 90 secondes ? Divisez l'audio en deux segments (par exemple 45 s chacun), générez deux clips en 720p et assemblez-les dans n'importe quel éditeur vidéo. L'identité reste cohérente car vous utilisez la même photo de référence.
Préparez plusieurs photos de la même personne
Avoir trois ou quatre photos de référence de la même personne, avec des tenues, des éclairages et des expressions différents, vous permet d'adapter la photo au ton du contenu. Une anecdote chaleureuse appelle une photo plus chaleureuse ; une mise à jour corporate appelle le portrait professionnel.
Constituez une bibliothèque de prompts
Sauvegardez les prompts de scène qui ont fonctionné. « Dégradé studio minimaliste » ou « lumière fenêtre bureau moderne » peuvent être réutilisés sur plusieurs projets pour assurer une cohérence visuelle.
Erreurs fréquentes et comment les corriger
La synchronisation labiale semble légèrement décalée
- Vérifiez la qualité de l'audio. Le bruit, les artefacts de compression ou un faible débit nuisent à l'extraction des phonèmes
- Vérifiez la durée. Les clips enregistrés exactement à la limite peuvent être coupés sur la dernière image : visez une seconde en dessous
- Essayez un enregistrement plus propre ou ré-exportez à un débit plus élevé
Le visage semble « plastique » ou trop lisse
- Utilisez une photo de plus haute résolution. Une entrée inférieure à 512 px produit un rendu flou
- Ajustez l'éclairage dans le prompt en optant pour « naturel » plutôt que « studio » pour plus de texture
Les gestes sont trop discrets
- Utilisez un audio plus expressif. Une voix monotone produit peu de variation dans les gestes
- Choisissez une photo avec une posture légèrement ouverte plutôt qu'un cadrage frontal rigide
L'arrière-plan ne correspond pas au prompt
- Soyez plus précis. « Bureau » est vague ; « bureau moderne avec une bibliothèque derrière le sujet et une grande fenêtre à gauche » est exploitable
- Tenez compte du contexte de la photo. Le modèle utilise l'arrière-plan de la photo comme référence
Calcul du coût selon les projets
Chaque vidéo OmniHuman v1.5 coûte 960 crédits (~9,60 $). Voici ce que cela représente concrètement :
| Projet | Vidéos nécessaires | Coût total |
|---|---|---|
| Publication LinkedIn unique | 1 | 9,60 $ |
| Série de bienvenue en cinq vidéos | 5 | 48 $ |
| Cours en dix leçons | 10 | 96 $ |
| Mises à jour hebdomadaires sur un an | 52 | 499,20 $ |
Comparez cela aux 24 à 48 $ par mois de HeyGen (même les mois où vous ne créez rien) ou aux 30 à 90 $ par mois de Synthesia. Pour des volumes faibles à modérés, OmniHuman permet d'économiser plusieurs centaines de dollars par an. Consultez détail complet des tarifs pour tous les paliers.
Payez par vidéo, pas par mois
Chaque talking head coûte 9,60 $, avec des formules d'abonnement abordables, sans minimum mensuel. Les crédits mensuels se renouvellent à chaque cycle de facturation. Les crédits achetés en supplément n'expirent jamais.
Générez votre première vidéoChecklist avant votre première vidéo
- Photo portrait, 1024x1024 ou plus, bien éclairée, expression neutre
- Fichier audio propre, moins de 60 secondes, sans musique ni réverbération
- Prompt de scène avec arrière-plan, éclairage, cadrage et style
- Compte Arteza avec au moins 960 crédits
- Choix de la résolution (720p ou 1080p)
- Décision sur le mode Turbo
- Ouvrez OmniHuman v1.5 et générez
Une fois votre première vidéo talking head publiée, explorez guide technique de synchronisation labiale, guide de flux de travail multilingue et des tutoriels par cas d'usage comme présentateurs de journaux télévisés et formation en entreprise.
Prêt à essayer OmniHuman v1.5 ? Commencer à créer gratuitement →
Try OmniHuman v1.5 - Right Now
Upload your reference image on the create page.
5 free generations · No credit card needed