OmniHuman v1.5: Creëer levensechte AI-avatars van één foto
De complete gids voor OmniHuman v1.5 op Arteza. Leer hoe je realistische AI-avatarvideo's maakt van één foto en audiobestand, inclusief functies, invoervereisten, prijzen, uitvoerspecificaties en praktische gebruiksscenario's.

Een foto. Een audiobestand. Een realistisch sprekende video voor $9,60 - betaalbare abonnementen, geen creditcardslot, geen maandelijks minimum. Dat is de belofte van OmniHuman v1.5, en deze gids laat je precies zien hoe het wordt geleverd.
SAMENVATTING
- Zet elke portretfoto plus een audiobestand om in een levensecht sprekende video
- 960 credits ($9,60) per generatie - betaal alleen wanneer je maakt
- 720p tot 60 seconden, of 1080p tot 30 seconden
- Fonemisch nauwkeurige lipsync, natuurlijke gebaren, audio-gestuurde uitdrukkingen
- Vanaf $5/maand. Stop wanneer je wilt, anders dan HeyGen ($24-$48/ma) of Synthesia ($30-$90/ma)
Wat OmniHuman v1.5 echt doet
OmniHuman v1.5 is ByteDance's vlaggenschip-avatarmodel, uitsluitend beschikbaar op Arteza. Je uploadt een enkele portretfoto en een spraakbestand, en het model genereert een volledige sprekende-hoofd-video: lipsync, oogknipperingen, hoofdknikken, schouderschuiften en micro-uitdrukkingen, allemaal vanaf nul gesynthetiseerd.
Dit is niet de oude 'plak een geanimeerde mond op een statisch gezicht'-truc. Elk frame wordt vers gegenereerd door een diffusietransformer die zowel identiteit als audio begrijpt. De persoon op je foto beweegt zoals een echt mens zou doen terwijl hij die specifieke audio voordraagt.
Als je Seedance 2.0 hebt gebruikt voor cinematische video's of Seedream voor afbeeldingsgeneratie, maakt OmniHuman v1.5 de set compleet: tekst naar afbeelding, afbeelding naar video, en nu foto plus audio naar avatar.
Maak nu je AI-presentator
Zet één foto + audio om in een levensecht sprekende video. $9,60 per video, betaalbare abonnementen.
Probeer OmniHuman gratis5 gratis generaties · Geen creditcard nodig
De vijf features die tellen
1. Fonemisch-niveau lipsync
Het model extraheert fonemen uit je audio en wijst ze frame voor frame toe aan exacte mondvormen. Explosieve klanken zoals 'p' en 'b' tonen lipsluiting. Fricatieven zoals 'f' en 'v' tonen tanden op lip. Klinkers produceren juiste kaakopening. Kijkers die met geluid kijken zullen het model niet betrappen op namaak.
2. Audio-gestuurde gezichtsuitdrukkingen
Als de audio enthousiast klinkt, heffen de wenkbrauwen zich. Als er een pauze voor nadruk is, vernauwen de ogen zich licht. Deze hints worden afgeleid uit vocale prosodie, niet ingebakken in starre sjablonen.
3. Natuurlijke gebaargeneratie
Schouderschuiften, hoofdkeer en subtiele houdingsveranderingen ontstaan uit het spraksignaal zelf. Een spreker die een punt maakt, buigt naar voren. Een spreker die items opsomt, verschuift het gewicht. De beweging correleert met betekenis, niet met een timer.
4. Turbo-modus
Snelheid nodig voor iteratie? Turbo-modus beperkt generatietijd zonder de 960-credit kosten te veranderen. Gebruik het om prompts en invoeren te bekijken, schakel dan over naar standaardmodus voor de heldenafbeelding.
5. Dubbele resolutie, dubbele duur
| Resolutie | Max audioduur | Beste voor |
|---|---|---|
| 720p (1280x720) | 60 seconden | Sociale clips, training, concepten |
| 1080p (1920x1080) | 30 seconden | Klantwerk, productdemo's, marketing |
Hoe de pijplijn werkt
Het begrijpen van de stadia helpt je het model beter voeding te geven.
Stadium 1: Identiteitsextractie. Een gezichtsencoder zet je foto om in een hoogdimensionale embedding die beenstructuur, huidskleur, oogvorm en honderden andere merkers vastlegt. Deze embedding houdt het gezicht consistent over elk frame.
Stadium 2: Audioanalyse. Het spraaknummer wordt geanalyseerd op fonemen, prosodie, energiecontour en emotionele toon.
Stadium 3: Bewegingssynthese. Een bewegingsnetwerk zet audiokenmerken om in per-frame parameters voor gezicht, hoofd en schouders.
Stadium 4: Diffusierendering. Een transformer genereert eindpixels, waarbij identiteit, beweging en je promptbeschrijving van de scene worden gecombineerd.
Stadium 5: Temporale samenhang. Een verfijningspass elimineert flikkering, schokken en identiteitsverschuiving tussen frames.
Wat je moet leveren
Referentiefoto
- Resolutie: minimaal 512x512, idealiter 1024x1024 of hoger
- Compositie: hoofd en schouders, gezicht minstens 30% van frame
- Verlichting: gelijkmatig en diffuus slaat harde schaduwen elke keer
- Uitdrukking: neutraal of licht aangenaam geeft het model het meest ruimte
- Formaat: JPEG of PNG
Audiobestand
- Formaat: MP3, WAV of M4A
- Duur: tot 60s bij 720p, tot 30s bij 1080p
- Kwaliteit: schone spraak zonder muziekbed, geen zware galm
- Taal: elke gesproken taal werkt
Tekstprompt
Beschrijf de scene: achtergrond ('modern kantoor met grote ramen'), verlichting ('zachte key light van links'), framing ('middelgrote shot, hoofd en schouders') en stylistische opmerkingen.
Prijsstelling: de betaal-per-gebruik-wiskunde
OmniHuman v1.5 kost 960 credits per video, gelijk aan ongeveer $9,60 tegen het basistarief. Er zijn betaalbare abonnementen. Je abonneert je, je geeft ze uit wanneer je genereert, en ongebruikte credits blijven in je account.
| Creditpakket | Prijs | Credits | Effectieve kosten per video |
|---|---|---|---|
| Starter | $10 | 1.050 | ~$9,14 |
| Popular | $25 | 2.750 | ~$8,73 |
| Pro | $50 | 5.750 | ~$8,35 |
| Max | $100 | 12.000 | ~$8,00 |
Waarom dit abonnementen verslaat
HeyGen begint op $24/maand met een maandelijks minutelimiet. Synthesia begint op $30/maand. D-ID begint op $5/maand voor een klein bedrag en schraalt tot $300/maand.
Met OmniHuman v1.5 betaal je niets in maanden waarin je niet maakt. Maak één video voor $9,60. Maak er tien voor $96. Maak nul en betaal nul. Nieuwe accounts krijgen ook 50 gratis credits bij aanmelding om Seedream en Seedance 1.0 Lite te verkennen voordat je koopt.
Zie de volledige verdeling in onze OmniHuman v1.5 prijsgids.
Klaar om OmniHuman v1.5 te proberen? Begin gratis te creëren →

Wil je een presentator zoals deze? Probeer OmniHuman gratis →
Stap voor stap: je eerste video in enkele minuten
- Bereid de foto voor. Kies een goed belicht portret, of genereer er een met Seedream.
- Bereid de audio voor. Neem jezelf op, of gebruik willekeurige TTS van hoge kwaliteit. Trim leidende en volgende stilte.
- Open het model. Ga naar arteza.ai en kies OmniHuman v1.5, of ga rechtstreeks naar modelpagina.
- Upload invoeren. Foto, audio en een korte sceneprompt.
- Configureer. Kies 720p of 1080p, zet turbo aan als je snelheid wilt.
- Genereer. Enkele minuten later is je video klaar.
- Bekijk en download. MP4 uit, klaar voor elke editor of elk platform.
Voor een diepere rondleiding, zie tutorial sprekend hoofd.
Echte use-cases die je aandacht verdienen
Bedrijfstraining - Consistente presentatorvideo's zonder planning van opnames. Update inhoud door audio uit te wisselen. Volledige gids.
E-learning - Cursusleerkrachten kunnen lessen op schaal verzenden. Avatars trekken beter aandacht dan statische dia's met voiceover. Volledige gids.
Verkoopsuitbreiding - Gepersonaliseerde videoboodschappen die prospects bij naam aanspreken. Volledige gids.
Klantenondersteuning - Videoantworden op veelgestelde vragen lossen problemen sneller op dan helpartikelen. Volledige gids.
YouTube en podcasting - AI-co-hosts, uitleggers en videoversies van audioshows. Zie YouTube en podcast gidsen.
Gezondheidsonderwijs - Patiëntenuitleggers in elke taal van één vertrouwd gezicht. Volledige gids.
Meertalige inhoud - Dezelfde foto, wissel audio uit, verzend tien taalversies met consistente identiteit. Volledige gids.
Tips die uitvoerkwaliteit verbeteren
Fotoselectie
- Gelijkmatige, zachte verlichting zonder harde schaduwen
- Rechtstreeks of licht drie-kwart hoek
- Handen weg van gezicht
- Schone achtergrond die contrasteert met het onderwerp
Voorbereiding audio
- Opnamen in een stille kamer met minimale galm
- Spreek in natuurlijk tempo, voeg echte pauzes in
- Normaliseer niveaus om clipping te voorkomen
- Strip muziek of omgevingsgeluid voordat je uploadt
Promptschrijving
- Wees specifiek: 'modern kantoor met grote ramen' slaat 'mooie achtergrond'
- Naam de verlichting: 'zachte studio key light' of 'warme middagzon'
- Geef de framing op: 'middelgroot close-up, hoofd en schouders'
- Weerspreken niet de foto (beschrijf geen ander haarkleur)
Iteratie
- Turbo-modus voor testruns
- Verander één variabele tegelijk
- Houd een bestand van prompts die werkten
OmniHuman v1.5 versus alternatieven
| Feature | OmniHuman v1.5 | HeyGen | Synthesia | D-ID |
|---|---|---|---|---|
| Aangepaste fotoinvoer | Ja | Beperkt | Nee (vooraf ingestelde avatars) | Ja |
| Lipsync-kwaliteit | Uitstekend | Goed | Goed | Matig |
| Gebaargeneratie | Audio-gestuurd | Op sjabloon gebaseerd | Op sjabloon gebaseerd | Beperkt |
| Maximale resolutie | 1080p | 1080p | 1080p | 1024x1024 |
| Prijsmodel | Betaal per gebruik | Abonnement | Abonnement | Gemengd |
| Kosten per video | ~$8-10 | $24-48/ma | $30-90/ma | $5-300/ma |
| Gratis credits bij aanmelding | 50 credits | Beperkte proefversie | Gratis proefversie | Beperkte proefversie |
Één-op-één vergelijkingen:
Ontsnap aan de maandelijkse abonnementsvalkuil
HeyGen, Synthesia en D-ID factureren je elke maand, zelfs wanneer je nul video's maakt. OmniHuman v1.5 factureren $9,60 alleen wanneer je maakt.
Genereer je eerste videoEerlijke beperkingen
- Duurlimiet. 60s bij 720p, 30s bij 1080p. Langere inhoud vereist stitching.
- Één persoon per video. Scenescènes met meerdere personen vereisen compositing.
- Alleen bovenlichaam. Geen full-body animatie.
- Audiokwaliteit telt. Slechte invoer, slechte lipsync.
- Niet real-time. Generaties nemen minuten in beslag, niet milliseconden.
- Geen live streaming. Output is een vooraf gerenderde MP4.
Veel gestelde vragen
Kan ik elke foto gebruiken?
Je kunt elke foto gebruiken die aan de invoervereisten voldoet, maar je bent verantwoordelijk voor rechten en toestemmingen. Arteza's servicevoorwaarden behandelen de juridische details.
Werkt het met niet-Engelstalige audio?
Ja. Elke gesproken taal werkt, met de hoogste nauwkeurigheid in talen met sterke trainingsrepresentatie. Zie meertalige gids.
Kan ik de uitvoer bewerken?
Ja. De uitvoer is een standaard MP4. Trim het, crop het, zet het samen: wat je editor ondersteunt.
Is er een API?
Ja. Zie API-gids.
Begin met maken
- Meld je aan voor Arteza en grijp je 50 gratis credits
- Koop credits: de $25 Popular-tier geeft je ongeveer 2-3 OmniHuman-video's
- Bereid een foto en audiobestand voor
- Open OmniHuman v1.5
- Upload, configureer, genereer
Betaalbare plannen vanaf $5/maand. Geen minimum. Zojuist $9,60 per levensecht sprekende video, wanneer je er een nodig hebt.
Klaar om OmniHuman v1.5 te proberen? Begin gratis te creëren →
Try OmniHuman v1.5 - Right Now
Upload your reference image on the create page.
5 free generations · No credit card needed