Hoe je AI talking head-video's maakt met OmniHuman v1.5
Een stapsgewijze tutorial voor het maken van professionele AI talking head-video's met OmniHuman v1.5 op Arteza. Leer alles over fotoselectie, audioforbereiding, het schrijven van prompts en optimalisatietechnieken voor de beste resultaten.

Je eerste OmniHuman v1.5 talking head-video maak je in ongeveer tien minuten van begin tot eind, en je betaalt precies $0,30-$7,20. Deze tutorial laat je elke stap, elke invoerkeuze en elk kwaliteitstechniek zien die we hebben geleerd van het genereren van duizenden talking head-video's op het platform.
TL;DR
- Je hebt één portretfoto, één audiobestand en een korte scènebeschrijving nodig
- Een video van 30 seconden kost 72 credits (~$7,20) - op abonnementen vanaf $5 per maand
- Kies 720p voor clips van 60 seconden of 1080p voor clips van 30 seconden
- Goede foto + heldere audio + specifieke prompt = professioneel resultaat in één keer
- Turbomodus voor iteratie, standaardmodus voor hero-content
Wat je nodig hebt voordat je begint
Drie invoerelementen, zonder uitzonderingen:
- Een portretfoto - hoofd en schouders, goed belicht, minimaal 512x512 pixels
- Een audiobestand - MP3, WAV of M4A, heldere spraak, maximaal 60 seconden
- Een scèneprompt - een korte beschrijving van de achtergrond en belichting
Plus een Arteza-account met voldoende credits voor je clip: 2,4 credits per seconde audio, dus 46 voor een video van 30 seconden. Nieuwe accounts ontvangen 10 gratis credits bij aanmelding, wat een korte testclip dekt. Met het Starter-abonnement van $5 maak je een maand lang volledige video's.
Maak nu je AI-presentator
Zet één foto + audio om in een levensechte praatfilm. $7,20 per video van 30 seconden op abonnementen vanaf $5 per maand.
OmniHuman gratis proberen5 gratis generaties · Geen creditcard nodig
Stap 1: Kies of maak de juiste foto
De foto is de grootste kwaliteitshefboom in het hele proces. Geef het model een geweldige foto en het levert een geweldige video. Geef het een gehaaste telefoonkiekje en de output weerspiegelt dat.
Wat een goede referentiefoto maakt
- Gelijkmatige belichting. Diffuus daglicht of zacht studiolicht. Geen harde schaduwen over het gezicht.
- Duidelijk gezicht. Ogen open, geen brillenreflectie, geen haar over de gelaatstrekken, geen handen bij het gezicht.
- Juiste kadrering. Hoofd en schouders zichtbaar. Het gezicht beslaat minimaal 30% van het beeld.
- Neutrale uitdrukking. Een ontspannen of licht vriendelijk gezicht geeft het model de meeste flexibiliteit.
- Schone achtergrond. Veel contrast tussen onderwerp en achtergrond helpt het model de identiteit te isoleren.
- Scherpe resolutie. 1024x1024 of groter. Geen bewegingsonscherpte.
Geen foto? Genereer er een
Als je een referentiefoto nodig hebt die je nog niet hebt, voor een virtuele woordvoerder, een persona of een personage, gebruik dan Seedream om er een te genereren. Gebruik als prompt "professionele portretfoto van [beschrijving], zacht studiolicht, neutrale achtergrond, kijkend in de camera" en kies het schoonste resultaat.
Bestandsformaten
JPEG en PNG werken beide. Transparante achtergronden zijn acceptabel. Het platform accepteert foto's van meerdere megabytes.
Stap 2: Bereid heldere audio voor
Je audio bepaalt de lipsynchronisatie, de gezichtsuitdrukking en het gebarenpatroon. Hoe helderder de audio, hoe meer het model ermee kan doen.
Opnameopties
Neem jezelf op. Een rustige ruimte en een fatsoenlijke USB-microfoon leveren audio op die schoon genoeg is voor OmniHuman. Spreek in een natuurlijk tempo, met natuurlijke pauzes. Overdrijf de uitspraak niet.
Gebruik een TTS-dienst. Elk kwalitatief tekst-naar-spraak-hulpmiddel werkt: ElevenLabs, Play.ht, Google, Amazon Polly. Exporteer op 44,1 kHz of 48 kHz, mono of stereo.
Extraheer uit bestaande audio. Een podcastsegment, een webinarclip of een voice-overopname werken allemaal, zolang de spraak geïsoleerd is.
Do's en don'ts bij audio
- Wel stilte aan het begin en einde wegknippen
- Wel audioniveaus normaliseren om clipping te voorkomen
- Niet muziek of zware omgevingsgeluiden in de mix laten staan
- Niet opnames met veel galm gebruiken
- Niet de maximale duur overschrijden: 60 seconden voor 720p, 30 seconden voor 1080p
Stap 3: Schrijf een scèneprompt die helpt
De scèneprompt beschrijft de visuele omgeving rondom je presentator. De prompt beschrijft de persoon niet, dat haalt het model uit de foto.
Goede promptstructuur
Een sterke prompt bevat vier elementen:
- Achtergrond - waar bevindt de persoon zich?
- Belichting - hoe is de scène verlicht?
- Kadrering - hoe dicht staat de camera?
- Stijl - eventuele opmerkingen over toon of afwerking?
Voorbeeldprompts die werken
Modern kantoor met grote ramen, zacht natuurlijk licht van links, medium close-up met hoofd en schouders, professionele broadcast-stijl.
Minimalistische studio-instelling met een zachte verloopachtergrond, gelijkmatig studiolicht, medium shot, strak en eigentijds uiterlijk.
Warm thuiskantoor met boekenplanken op de achtergrond, gouden middagzonlicht, medium close-up, natuurlijke en toegankelijke uitstraling.
Wat je in prompts moet vermijden
- Beschrijf de persoon niet (haarkleur, leeftijd, outfit), de foto regelt dat
- Spreek de foto niet tegen (geen "witte achtergrond" als de foto een zwarte achtergrond heeft, tenzij je echt wilt dat het model die vervangt)
- Gebruik geen vage zinnen als "goede belichting", kies een specifieke lichtbron
- Overlaad de prompt niet met meer dan vijf of zes details
Stap 4: Uploaden en configureren
Open arteza.ai en selecteer OmniHuman v1.5, of ga direct naar modelpagina.
Uploadvolgorde
- Referentiefoto - sleep het portret naar het afbeeldingsvak
- Audiobestand - sleep het spraakbestand naar het audiovak
- Scèneprompt - plak je scènebeschrijving
Instellingen configureren
- Resolutie: 720p voor concepten of clips langer dan 30 seconden, 1080p voor professionele eindversies
- Turbomodus: aan voor iteratie, uit voor eindkwaliteit
- Creditkosten controleren: de interface bevestigt de exacte creditkosten voordat je genereert
Stap 5: Genereren en bekijken
Klik op genereren. De standaardmodus duurt enkele minuten. De turbomodus is sneller. Je ontvangt een melding wanneer de video klaar is.
De output beoordelen
Speel de video op volledig formaat af en controleer deze vier punten:
- Lipsynchronisatie - komen de mondvormen overeen met de klanken?
- Identiteit - ziet het gezicht er gedurende de hele video uit als de referentie?
- Natuurlijkheid van gebaren - voelt de beweging organisch aan, niet robotachtig?
- Achtergrondconsistentie - komt de scène overeen met je prompt?
Als iets niet klopt, ligt de oplossing bijna altijd in de invoer, niet in een herstart. Wissel de foto, verbeter de audio of scherpte de prompt aan.
Klaar om OmniHuman v1.5 te proberen? Begin gratis met maken →

Wil je een presentator zoals deze? Probeer OmniHuman gratis →
Geavanceerde tips uit echte productieprocessen
Gebruik turbo voor verkenning, standaard voor eindversies
De turbomodus kost hetzelfde als de standaardmodus voor dezelfde audio, maar verkort de wachttijd. Gebruik hem om snel verschillende prompts of audio-takes te testen en render de eindversie daarna in de standaardmodus.
Stem de emotie van de audio af op de uitdrukking van de referentie
Als je foto een neutraal gezicht toont maar je audio is heel levendig, genereert het model veel beweging. Als de audio rustig is en de foto toont een glimlach, verwacht dan subtiele variatie. Stem ze op elkaar af voor voorspelbare resultaten.
Splits lange content op in segmenten
Heb je een video van 90 seconden nodig? Splits de audio op in twee segmenten (bijvoorbeeld elk 45 seconden), genereer twee 720p-clips en voeg ze samen in een willekeurige videoeditor. De identiteit blijft consistent omdat je dezelfde referentiefoto gebruikt.
Bereid meerdere foto's van dezelfde persoon voor
Drie of vier referentiefoto's van dezelfde persoon, met verschillende outfits, belichting en uitdrukkingen, stellen je in staat de foto af te stemmen op de toon van de content. Een warm verhaal krijgt een warmere foto; een zakelijke update krijgt de portretfoto.
Houd een promptbibliotheek bij
Sla scèneprompts op die goed werkten. "Minimalistische studioachtergrond met verloop" of "modern kantoor met raamlicht" kunnen projectoverstijgend worden hergebruikt voor visuele consistentie.
Veelgemaakte fouten en hoe je ze oplost
Lipsynchronisatie voelt iets af
- Controleer de audiokwaliteit. Ruis, compressieartefacten of een lage bitrate verstoren de klankextractie
- Controleer de duur. Clips die precies op de maximumlengte zitten, kunnen op het laatste frame worden afgeknipt, streef naar een seconde korter
- Probeer een schonere opname of exporteer opnieuw op een hogere bitrate
Gezicht ziet er "plastisch" of te glad uit
- Gebruik een foto met hogere resolutie. Invoer onder 512 pixels levert zachte output op
- Pas de promptbelichting aan naar "naturel" in plaats van "studio" voor meer textuur
Gebaren zijn te subtiel
- Gebruik expressievere audio. Monotone spraak leidt tot minimale gebarenvariatie
- Kies een foto met een iets open houding in plaats van stijve frontale kadrering
Achtergrond komt niet overeen met de prompt
- Wees specifieker. "Kantoor" is vaag; "modern kantoor met een boekenkast achter het onderwerp en een groot raam links" is concreet
- Stem de fotocontext af. Het model gebruikt de achtergrond van de foto als referentie
Kostenoverzicht voor verschillende projecten
Elke OmniHuman v1.5-video kost 3-72 credits ($0,30-$7,20). Hier zie je hoe dat er in de praktijk uitziet:
| Project | Benodigde video's | Totale kosten |
|---|---|---|
| Enkele LinkedIn-post | 1 | $7,20 |
| Welkomstserie van vijf video's | 5 | $36 |
| Cursus van tien lessen | 10 | $72 |
| Wekelijkse updates gedurende een jaar | 52 | $499,20 |
Vergelijk dat met HeyGen's $24-$48 per maand (ook in maanden dat je niets maakt) of Synthesia's $30-$90 per maand. Bij lage en gemiddelde volumes bespaar je met OmniHuman honderden dollars per jaar. Bekijk de volledige prijsoverzicht voor alle niveaus.
Betaal per video, niet per maand
Een talking head van 30 seconden kost $7,20, op abonnementen vanaf $5 per maand zonder jaarcontract. Maandelijkse credits worden elke factuurcyclus vernieuwd. Extra credits verlopen nooit.
Genereer je eerste videoChecklist voor je eerste video
- Portretfoto, 1024x1024 of groter, goed belicht, neutrale uitdrukking
- Schoon audiobestand, minder dan 60 seconden, geen muziek of galm
- Scèneprompt met achtergrond, belichting, kadrering en stijl
- Arteza-account met minimaal 72 credits
- Resolutiekeuze (720p of 1080p)
- Beslissing over turbomodus
- Open OmniHuman v1.5 en genereer
Zodra je je eerste talking head hebt gemaakt, verken je de technische handleiding voor lipsynchronisatie, de handleiding voor meertalige workflows en gebruiksscenario-specifieke tutorials zoals nieuwsankers en bedrijfstraining.
Klaar om OmniHuman v1.5 te proberen? Begin gratis met maken →
OmniHuman v1.5 uitproberen - Nu!
Upload je referentieafbeelding op de aanmaakpagina.
5 gratis generaties · Geen creditcard nodig