Sådan laver du AI talking head-videoer med OmniHuman v1.5
En trin-for-trin-vejledning til at skabe professionelle AI talking head-videoer med OmniHuman v1.5 på Arteza. Lær om fotovalg, lydforberedelse, prompt-skrivning og optimeringsteknikker for de bedste resultater.

Din første OmniHuman v1.5 talking head-video tager cirka ti minutter fra start til slut, og den koster præcis $0,30-$7,20. Denne vejledning viser dig hvert trin, hver inputbeslutning og hvert kvalitetstrick, vi har lært af at generere tusindvis af talking head-videoer på platformen.
TL;DR
- Du skal bruge ét portrætfoto, én lydfil og en kort scenebeskrivelse
- En 30-sekunders video koster 72 credits (~$7,20) på abonnementer fra $5 om måneden
- Vælg 720p til 60-sekunders klip eller 1080p til 30-sekunders klip
- Godt foto + ren lyd + præcis prompt = professionelt resultat ved første forsøg
- Turbo-tilstand til iteration, standardtilstand til færdigt indhold
Det skal du have klar, inden du starter
Tre input, ingen undtagelser:
- Et portrætfoto - hoved og skuldre, godt belyst, minimum 512x512 pixels
- En lydfil - MP3, WAV eller M4A, klar tale, op til 60 sekunder
- En scenebeskrivelse - en kort beskrivelse af baggrunden og belysningen
Plus en Arteza-konto med nok credits til dit klip: 2,4 credits pr. sekund lyd, altså 46 for en 30-sekunders video. Nye konti får 10 gratis credits ved tilmelding, hvilket dækker et kort testklip, og $5 Starter-abonnementet dækker en måneds fuld-længde klip.
Opret din AI-præsentant nu
Forvandl ét foto og lyd til en livagtig talende video. $7,20 pr. 30-sekunders video på abonnementer fra $5 om måneden.
Prøv OmniHuman gratis5 gratis generationer · Intet kreditkort påkrævet
Trin 1: Vælg eller skab det rette foto
Fotoet er den enkelt vigtigste kvalitetsfaktor i hele arbejdsgangen. Giv modellen et godt foto, og den returnerer en god video. Giv den et hastigt mobilsnap, og outputtet vil afspejle det.
Hvad gør et godt referencefoto
- Jævn belysning. Diffust naturligt lys eller blødt studielys. Ingen hårde skygger hen over ansigtet.
- Tydeligt ansigt. Øjne åbne, ingen brilleblænding, intet hår der dækker trækkene, ingen hænder tæt på ansigtet.
- Rigtig indramning. Hoved og skuldre synlige. Ansigtet fylder mindst 30% af billedet.
- Neutralt udtryk. Et afslappet eller let venligt ansigt giver modellen mest fleksibilitet.
- Ren baggrund. Høj kontrast mellem motiv og baggrund hjælper modellen med at isolere identiteten.
- Skarp opløsning. 1024x1024 eller større. Ingen bevægelsesslør.
Har du ikke et foto? Generer ét
Hvis du har brug for et referencefoto, du ikke allerede har, til en virtuel talsperson, en persona eller en karakter, kan du bruge Seedream til at generere et. Brug prompten "professionelt headshot af [beskrivelse], blød studiobelysning, neutral baggrund, kigger ind i kameraet" og vælg det reneste resultat.
Formater
JPEG og PNG fungerer begge. Gennemsigtige baggrunde er acceptable. Platformen accepterer fotos op til flere megabyte.
Trin 2: Forbered ren lyd
Din lyd bestemmer læbesync, ansigtsudtryk og gestikulations-mønsteret. Jo renere lyden er, jo mere har modellen at arbejde med.
Optagemuligheder
Optag selv. Et stille rum og en anstændig USB-mikrofon giver lyd, der er ren nok til OmniHuman. Tal i et naturligt tempo med naturlige pauser. Overtydeliger ikke.
Brug en TTS-tjeneste. Et hvilket som helst kvalitets-tekst-til-tale-værktøj fungerer: ElevenLabs, Play.ht, Google, Amazon Polly. Eksporter i 44,1 kHz eller 48 kHz mono eller stereo.
Udtræk fra eksisterende lyd. Et podcastafsnit, et webinarklip eller en voice-over-optagelse fungerer alle, så længe talen er isoleret.
Hvad du bør og ikke bør gøre med lyd
- Gør trim indledende og afsluttende stilhed
- Gør normaliser lydniveauerne for at forhindre klipning
- Undgå at efterlade musik eller kraftige omgivelsesstøj i mixet
- Undgå optagelser i rum med kraftig rumklang
- Undgå at overskride tidsgrænsen: 60 sekunder for 720p, 30 sekunder for 1080p
Trin 3: Skriv en scenebeskrivelse, der hjælper
Scenebeskrivelsen beskriver det visuelle miljø omkring din præsentant. Den beskriver ikke personen, det får modellen fra fotoet.
God promptstruktur
En stærk prompt indeholder fire elementer:
- Baggrund - hvor befinder personen sig?
- Belysning - hvordan er scenen belyst?
- Indramning - hvor tæt er kameraet?
- Stil - eventuelle noter om tone eller finish?
Eksempler på prompts, der virker
Moderne kontormiljø med store vinduer, blødt naturligt lys fra venstre, halvtæt indramning af hoved og skuldre, professionel broadcast-stil.
Minimalistisk studiesetting med en blød gradueret baggrund, jævnt studielys, halvtæt billede, rent og tidssvarende look.
Varmt hjemmekontor med bogreoler i baggrunden, gylden eftermiddagssol, halvtæt indramning, naturlig og imødekommende tone.
Hvad du bør undgå i prompts
- Beskriv ikke personen (hårfarve, alder, tøj), det klarer fotoet
- Modsigerr ikke fotoet (ikke "hvid baggrund", hvis fotoet har en sort baggrund, medmindre du virkelig vil have modellen til at erstatte den)
- Undgå vage vendinger som "god belysning", vælg en specifik lyskilde
- Overbelast ikke prompten med mere end fem eller seks detaljer
Trin 4: Upload og konfigurer
Åbn arteza.ai og vælg OmniHuman v1.5, eller gå direkte til modelside.
Uploadrækkefølge
- Referencefoto - træk portrættet ind i billedfeltet
- Lydfil - slip talfilen ind i lydfeltet
- Scenebeskrivelse - indsæt din scenebeskrivelse
Konfigurer indstillingerne
- Opløsning: 720p til kladder eller klip længere end 30 sekunder, 1080p til professionelle endelige renders
- Turbo-tilstand: til ved iteration, fra til endelig kvalitet
- Gennemse creditomkostning: brugerfladen bekræfter den præcise creditomkostning, inden du genererer
Trin 5: Generer og gennemgå
Klik på generer. Standardtilstand tager flere minutter. Turbo-tilstand er hurtigere. Du får en besked, når videoen er klar.
Gennemgang af outputtet
Afspil videoen i fuld størrelse og tjek disse fire ting:
- Læbesync - stemmer mundformerne overens med fonemerne?
- Identitet - ligner ansigtet referencen hele vejen igennem?
- Naturlige bevægelser - føles bevægelserne organiske og ikke robotagtige?
- Baggrundskonsistens - stemmer scenen overens med din prompt?
Hvis noget af dette føles forkert, ligger løsningen næsten altid i inputtet, ikke i et nyt forsøg. Skift foto, rens lyden eller præciser prompten.
Klar til at prøve OmniHuman v1.5? Begynd at skabe gratis →

Vil du have en præsentant som denne? Prøv OmniHuman gratis →
Avancerede tips fra virkelige produktionsflows
Brug Turbo til udforskning, standard til færdige versioner
Turbo-tilstand koster det samme som standardtilstand for den samme lyd, men afkorter ventetiden. Brug den til hurtigt at teste forskellige prompts eller lydoptagelser, og render derefter den endelige version i standardtilstand.
Match lyd-emotion til referencefotoets udtryk
Hvis dit foto viser et neutralt ansigt, men din lyd er meget animeret, genererer modellen mange bevægelser. Hvis lyden er rolig og fotoet smilende, kan du forvente subtil variation. Match dem for forudsigelige resultater.
Opdel langt indhold i segmenter
Har du brug for en 90-sekunders video? Opdel lyden i to segmenter (f.eks. 45 sekunder hver), generer to 720p-klip og sæt dem sammen i et hvilket som helst videoprogram. Identiteten forbliver konsistent, fordi du bruger det samme referencefoto.
Forbered flere fotos af den samme person
At have tre eller fire referencebilleder af den samme person, med forskellige tøj, forskellig belysning og forskellige udtryk, lader dig matche fotoet med indholdets tone. En varm anekdote får et varmere foto, en virksomhedsopdatering får headshot-billedet.
Hold et promptbibliotek
Gem scenebeskrivelser, der virkede. "Minimalistisk studiegraderingsbaggrund" eller "moderne kontor med vinduelys" kan genbruges på tværs af projekter for visuel konsistens.
Almindelige fejl og hvordan du løser dem
Læbesynkronisering føles lidt forkert
- Tjek lydkvaliteten. Støj, kompressionsartefakter eller lav bitrate forringer fonemudtrækning
- Tjek varigheden. Klip, der er præcis ved grænsen, kan blive skåret af på det sidste frame, sigt efter et sekund under grænsen
- Prøv en renere optagelse eller re-eksporter med højere bitrate
Ansigtet ser "plastikagtig" ud eller for glat
- Brug et foto med højere opløsning. Input under 512 pixels giver blødt output
- Juster promptens belysning til "naturlig" i stedet for "studie" for mere tekstur
Gestikulation er for subtil
- Brug mere udtryksfuld lyd. Monoton tale giver minimal gestikationsvariation
- Vælg et foto med en let åben kropsholdning frem for stiv frontal indramning
Baggrunden matcher ikke prompten
- Vær mere specifik. "Kontor" er vagt; "moderne kontor med en reol bag motivet og et stort vindue til venstre" er handlingsorienteret
- Match fotokonteksten. Modellen bruger fotobaggrunden som reference
Omkostningsberegning for forskellige projekter
Hver OmniHuman v1.5-video koster 3-72 credits ($0,30-$7,20). Sådan ser det ud i praksis:
| Projekt | Videoer i alt | Samlet pris |
|---|---|---|
| Enkelt LinkedIn-opslag | 1 | $7,20 |
| Fem-video velkomstserie | 5 | $36 |
| Kursus med ti lektioner | 10 | $72 |
| Ugentlige opdateringer i et år | 52 | $499,20 |
Sammenlign det med HeyGens $24-$48 om måneden (selv i måneder du ikke opretter noget) eller Synthesivas $30-$90 om måneden. Ved lavt og moderat volumen sparer OmniHuman hundredvis af dollars om året. Se fuld prisoversigt for hvert niveau.
Betal pr. video, ikke pr. måned
En 30-sekunders talking head-video koster $7,20 på abonnementer fra $5 om måneden uden årskontrakt. Månedlige credits fornyes ved hver faktureringscyklus. Opkøbte credits udløber aldrig.
Generer din første videoTjekliste til din første video
- Portrætfoto, 1024x1024 eller større, godt belyst, neutralt udtryk
- Ren lydfil, under 60 sekunder, ingen musik eller rumklang
- Scenebeskrivelse med baggrund, belysning, indramning og stil
- Arteza-konto med mindst 72 credits
- Valg af opløsning (720p eller 1080p)
- Beslutning om turbo-tilstand
- Åbn OmniHuman v1.5 og generer
Når du har leveret din første talking head-video, kan du udforske teknisk guide til læbesynkronisering, guide til flersproget arbejdsgang og brugssagsspecifikke vejledninger som nyhedsoplæsere og virksomhedstræning.
Klar til at prøve OmniHuman v1.5? Begynd at skabe gratis →
Prøv OmniHuman v1.5 - Lige nu
Upload dit referencebillede på opret-siden.
5 gratis generationer · Intet kreditkort påkrævet