OmniHuman v1.5: maak levensechte AI-avatars van één foto
De complete gids voor OmniHuman v1.5 op Arteza. Leer hoe je realistische AI-avatarvideo's maakt van één foto en audiobestand, inclusief functies, invoervereisten, prijzen, outputspecificaties en praktische toepassingen.

Één foto. Één audiobestand. Één realistische pratende video voor $7,20, op abonnementen vanaf $5 per maand, zonder creditcardbinding en zonder jaarcontract. Dat is de belofte van OmniHuman v1.5, en in deze gids laten we je precies zien hoe het dat waarmaakt.
TL;DR
- Zet elke portretfoto plus een audiobestand om in een levensechte pratende video
- 3-72 credits ($0,30-$7,20) per generatie - betaal alleen wanneer je iets maakt
- 720p tot 60 seconden, of 1080p tot 30 seconden
- Foneem-nauwkeurige lipsynchronisatie, natuurlijke gebaren, audio-gedreven expressies
- Vanaf $5/maand. Op elk moment opzegbaar, in tegenstelling tot HeyGen ($24-$48/maand) of Synthesia ($30-$90/maand)
Wat OmniHuman v1.5 eigenlijk doet
OmniHuman v1.5 is het vlaggenschip-avatarmodel van ByteDance, uitsluitend beschikbaar op Arteza. Je uploadt een enkele portretfoto en een gesproken audiobestand, waarna het model een complete pratende-hoofd-video genereert: lipsynchronisatie, oogknipperingen, hoofdbewegingen, schouderbeweging en micro-expressies worden allemaal vanaf nul gesynthetiseerd.
Dit is niet de oude truc van 'een geanimeerde mond op een statisch gezicht plakken'. Elk frame wordt opnieuw gegenereerd door een diffusion transformer die zowel identiteit als audio begrijpt. De persoon op je foto beweegt zoals een echte mens dat zou doen terwijl die specifieke audio wordt afgespeeld.
Als je Seedance 2.0 al hebt gebruikt voor cinematische video of Seedream voor beeldgeneratie, vormt OmniHuman v1.5 de perfecte aanvulling: tekst naar afbeelding, afbeelding naar video, en nu foto plus audio naar avatar.
Maak nu je AI-presentator
Zet één foto en audio om in een levensechte pratende video. $7,20 per video van 30 seconden op abonnementen vanaf $5 per maand.
Probeer OmniHuman gratis5 gratis generaties · Geen creditcard nodig
De vijf functies die ertoe doen
1. Lipsynchronisatie op foneem-niveau
Het model extraheert fonemen uit je audio en koppelt ze frame voor frame aan exacte mondvormen. Plosieven zoals 'p' en 'b' laten lipsluiting zien. Fricatieven zoals 'f' en 'v' tonen tanden op lip. Klinkers zorgen voor een juiste kaakopening. Kijkers die met geluid kijken zullen het model er niet op betrappen dat het vals speelt.
2. Audio-gedreven gezichtsuitdrukkingen
Klinkt de audio enthousiast, dan gaan de wenkbrauwen omhoog. Is er een pauze voor nadruk, dan knijpen de ogen iets samen. Deze signalen worden afgeleid uit de vocale prosodie, niet ingebakken in starre sjablonen.
3. Natuurlijke gebaarproductie
Schouverbewegingen, hoofddraaibewegingen en subtiele houdingsveranderingen komen voort uit het spraaksignaal zelf. Een spreker die een punt maakt, leunt naar voren. Iemand die items opsomt, verschuift van gewicht. De beweging correleert met betekenis, niet met een timer.
4. Turbomodus
Heb je snelheid nodig voor iteratie? De turbomodus verkort de generatietijd zonder de creditkosten te wijzigen. Gebruik hem om prompts en invoer te bekijken, en schakel daarna over op de standaardmodus voor de definitieve render.
5. Dubbele resolutie, dubbele duur
| Resolutie | Maximale audioduur | Beste voor |
|---|---|---|
| 720p (1280x720) | 60 seconden | Social clips, training, concepten |
| 1080p (1920x1080) | 30 seconden | Klantwerk, productdemo's, marketing |
Hoe de pipeline werkt
Inzicht in de stappen helpt je het model betere invoer te geven.
Stap 1: Identiteitsextractie. Een gezichtsencoder zet je foto om in een hoogdimensionale embedding die botstructuur, huidskleur, oogvorm en honderden andere kenmerken vastlegt. Deze embedding houdt het gezicht in elk frame consistent.
Stap 2: Audio-analyse. Het gesproken spoor wordt geanalyseerd op fonemen, prosodie, energiecontour en emotionele toon.
Stap 3: Bewegingssynthese. Een bewegingsnetwerk vertaalt audio-kenmerken naar per-frame-parameters voor gezicht, hoofd en schouders.
Stap 4: Diffusion-rendering. Een transformer genereert de uiteindelijke pixels door identiteit, beweging en je promptbeschrijving van de scène te combineren.
Stap 5: Temporele coherentie. Een verfijningsstap elimineert flikkering, schokbeweging en identiteitsdrift tussen frames.
Wat je moet aanleveren
Referentiefoto
- Resolutie: minimaal 512x512, bij voorkeur 1024x1024 of hoger
- Compositie: hoofd en schouders, gezicht minimaal 30% van het frame
- Belichting: egaal en diffuus is altijd beter dan harde schaduwen
- Uitdrukking: neutraal of licht aangenaam geeft het model de meeste speelruimte
- Formaat: JPEG of PNG
Audiobestand
- Formaat: MP3, WAV of M4A
- Duur: tot 60s bij 720p, tot 30s bij 1080p
- Kwaliteit: helder gesproken woord zonder muziekachtergrond en zonder zware galm
- Taal: elke gesproken taal werkt
Tekstprompt
Beschrijf de scène: achtergrond ('modern kantoor met grote ramen'), belichting ('zachte hoofdlamp van links'), kadrering ('halftotaal, hoofd en schouders') en eventuele stijlnotities.
Prijzen: de rekening per gebruik
OmniHuman v1.5 kost 2,4 credits per seconde audio, dat is 72 credits, ofwel ongeveer $7,20, voor een video van 30 seconden op het basistarief. Credits komen met een maandabonnement vanaf $5. Je schrijft je in, besteedt ze wanneer je genereert, en het saldo wordt elke factuurcyclus vernieuwd.
| Maandabonnement | Prijs | Credits | Effectieve kosten per video van 30 seconden |
|---|---|---|---|
| Starter | $5/maand | 60 | ~$3,83 |
| Creator | $25/maand | 300 | ~$3,83 |
| Pro | $50/maand | 700 | ~$3,29 |
| Studio | $120/maand | 1.800 | ~$3,07 |
Waarom dit beter is dan vaste abonnementen
HeyGen begint bij $24/maand met een maandelijks minutenplafond. Synthesia begint bij $30/maand. D-ID begint bij $5/maand voor een beperkt tegoed en loopt op tot $300/maand.
Met OmniHuman v1.5 betaal je niets in maanden dat je niets maakt. Maak één video van 30 seconden voor $7,20. Maak er tien voor $72. Maak er geen en betaal niets. Nieuwe accounts ontvangen ook 10 gratis credits bij aanmelding om Seedream en Seedance 1.0 Lite te verkennen voor je iets koopt.
Bekijk de volledige uitsplitsing in onze Prijsgids voor OmniHuman v1.5.
Klaar om OmniHuman v1.5 te proberen? Gratis beginnen →

Wil je een presentator zoals deze? OmniHuman gratis proberen →
Stap voor stap: je eerste video in enkele minuten
- Bereid de foto voor. Kies een goed belicht portret, of genereer er een met Seedream.
- Bereid de audio voor. Neem jezelf op, of gebruik een kwalitatieve TTS. Knip stilte aan het begin en einde weg.
- Open het model. Ga naar arteza.ai en kies OmniHuman v1.5, of ga direct naar de modelpagina.
- Upload je invoer. Foto, audio en een korte scèneprompt.
- Configureer. Kies 720p of 1080p, zet turbomodus aan als je snelheid wilt.
- Genereer. Een paar minuten later is je video klaar.
- Bekijk en download. MP4-uitvoer, klaar voor elke editor of elk platform.
Voor een uitgebreidere handleiding, zie de tutorial voor pratende hoofden.
Praktische toepassingen die de moeite waard zijn
Bedrijfstraining - Consistente presentatorvideo's zonder opnamesessies te plannen. Werk content bij door simpelweg de audio te wisselen. Volledige gids.
E-learning - Cursusinstructeurs kunnen op grote schaal lessen uitbrengen. Avatars houden de aandacht beter vast dan statische dia's met een voice-over. Volledige gids.
Salesbenadering - Gepersonaliseerde videoboodschappen die prospects bij naam aanspreken. Volledige gids.
Klantenservice - Video-antwoorden op veelgestelde vragen lossen problemen sneller op dan helpartikelen. Volledige gids.
YouTube en podcasting - AI-co-hosts, uitlegsegmenten en videoversies van audioprogramma's. Zie de gidsen voor YouTube en podcast.
Gezondheidszorgonderwijs - Patiëntuitleg in elke taal vanuit één vertrouwd gezicht. Volledige gids.
Meertalige content - Dezelfde foto, andere audio, tien taalversies met een consistente identiteit. Volledige gids.
Tips voor betere uitvoerkwaliteit
Fotoselectie
- Egale, zachte belichting zonder harde schaduwen
- Frontaal of licht driekwarthoek
- Handen uit het gezicht
- Schone achtergrond die contrasteert met het onderwerp
Audiobereiding
- Neem op in een stille ruimte met minimale galm
- Spreek op een natuurlijk tempo, met echte pauzes
- Normaliseer het niveau om clipping te voorkomen
- Verwijder muziek of omgevingsgeluid voor het uploaden
Promptschrijven
- Wees specifiek: 'modern kantoor met grote ramen' is beter dan 'mooie achtergrond'
- Benoem de belichting: 'zachte studiohoofdlamp' of 'warm middagzonlicht'
- Geef de kadrering aan: 'halftotaal, hoofd en schouders'
- Spreek de foto niet tegen (beschrijf geen andere haarkleur)
Iteratie
- Turbomodus voor testrondes
- Verander één variabele tegelijk
- Bewaar een bestand met prompts die werkten
OmniHuman v1.5 versus de alternatieven
| Functie | OmniHuman v1.5 | HeyGen | Synthesia | D-ID |
|---|---|---|---|---|
| Aangepaste foto-invoer | Ja | Beperkt | Nee (vaste avatars) | Ja |
| Lipsynchronisatiekwaliteit | Uitstekend | Goed | Goed | Matig |
| Gebaarproductie | Audio-gestuurd | Sjabloongebaseerd | Sjabloongebaseerd | Beperkt |
| Maximale resolutie | 1080p | 1080p | 1080p | 1024x1024 |
| Prijsmodel | Betalen per gebruik | Abonnement | Abonnement | Gemengd |
| Kosten per video | ~$7,20 voor 30s | $24-48/maand | $30-90/maand | $5-300/maand |
| Gratis credits bij aanmelding | 10 credits | Beperkte proefperiode | Gratis proefperiode | Beperkte proefperiode |
Directe vergelijkingen:
Ontsnap aan de maandelijkse abonnementsvalkuil
HeyGen, Synthesia en D-ID rekenen elke maand kosten, ook als je geen enkele video maakt. OmniHuman v1.5 rekent $7,20 alleen wanneer je iets maakt.
Genereer je eerste videoEerlijke beperkingen
- Duurbeperkingen. 60s bij 720p, 30s bij 1080p. Langere content vereist samenvoegen.
- Één persoon per video. Scènes met meerdere personen vereisen compositing.
- Alleen bovenlichaam. Geen animatie van het volledige lichaam.
- Audiokwaliteit is bepalend. Slechte invoer geeft slechte lipsynchronisatie.
- Niet realtime. Generaties duren minuten, niet milliseconden.
- Geen live streaming. De uitvoer is een vooraf gerenderde MP4.
Veelgestelde vragen
Kan ik elke foto gebruiken?
Je kunt elke foto gebruiken die aan de invoervereisten voldoet, maar je bent zelf verantwoordelijk voor rechten en toestemmingen. De gebruiksvoorwaarden van Arteza bevatten de juridische details.
Werkt het ook met niet-Engelstalige audio?
Ja. Elke gesproken taal werkt, met de hoogste nauwkeurigheid voor talen die sterk vertegenwoordigd zijn in de trainingsdata. Zie de meertalige gids.
Kan ik de uitvoer bewerken?
Ja. De uitvoer is een standaard MP4. Knip het bij, snijd het uit, gebruik compositing: alles wat je editor ondersteunt.
Is er een API?
Ja. Zie de API-gids.
Begin met maken
- Aanmelden bij Arteza en claim je 10 gratis credits
- Schrijf je in: het Creator-abonnement van $25 geeft je 300 credits, goed voor ongeveer 6 OmniHuman-video's van dertig seconden
- Bereid een foto en audiobestand voor
- Open OmniHuman v1.5
- Upload, configureer en genereer
Betaalbare abonnementen vanaf $5/maand. Geen minimum. Gewoon $7,20 per levensechte pratende video van 30 seconden, wanneer je er één nodig hebt.
Klaar om OmniHuman v1.5 te proberen? Gratis beginnen →
OmniHuman v1.5 uitproberen - Nu!
Upload je referentieafbeelding op de aanmaakpagina.
5 gratis generaties · Geen creditcard nodig