Så skapar du AI-talkinghead-videor med OmniHuman v1.5
En steg-för-steg-guide för att skapa professionella AI-talkinghead-videor med OmniHuman v1.5 på Arteza. Lär dig fotovals, ljudförberedelse, promptskrivning och optimeringstekniker för bästa resultat.

Din första OmniHuman v1.5-video med talande huvud tar ungefär tio minuter från start till mål, och den kostar exakt $0,30-$7,20. Den här guiden visar dig varje steg, varje val och varje kvalitetstrick vi har lärt oss av att generera tusentals sådana videor på plattformen.
Sammanfattning
- Du behöver ett porträttfoto, en ljudfil och en kort scenprompt
- En 30-sekunders video kostar 72 credits (~$7.20) - i planer från $5 i månaden
- Välj 720p för 60-sekundersklipp eller 1080p för 30-sekundersklipp
- Bra foto + rent ljud + specifik prompt = professionellt resultat på första försöket
- Turboläge för iteration, standardläge för färdigt innehåll
Vad du behöver innan du börjar
Tre indata, inga undantag:
- Ett porträttfoto - huvud och axlar, bra belysning, minst 512x512 pixlar
- En ljudfil - MP3, WAV eller M4A, tydligt tal, upp till 60 sekunder
- En scenprompt - en kort beskrivning av bakgrunden och ljussättningen
Plus ett Arteza-konto med tillräckligt med credits för ditt klipp: 2,4 credits per sekund ljud, alltså 46 för en 30-sekunders video. Nya konton får 10 gratis credits vid registrering, vilket räcker för ett kort testklipp, och Starter-planen för $5 täcker en månads fullängdsklipp.
Skapa din AI-presentatör nu
Förvandla ett foto och ljud till en livfull talvideo. $7.20 per 30-sekunders video i planer från $5 i månaden.
Prova OmniHuman gratis5 gratis generationer · Inget kreditkort krävs
Steg 1: Välj eller skapa rätt foto
Fotot är den enskilt viktigaste kvalitetsfaktorn i hela arbetsflödet. Ge modellen ett bra foto och den ger dig en bra video. Ge den ett hastigt taget mobilfoto och resultatet kommer att spegla det.
Vad som gör ett bra referensfoto
- Jämn belysning. Diffust naturligt ljus eller mjukt studiobelysning. Inga hårda skuggor över ansiktet.
- Tydligt ansikte. Ögonen öppna, inga glasreflexer, inga hår som täcker ansiktsdragen, inga händer nära ansiktet.
- Rätt bildutsnitt. Huvud och axlar synliga. Ansiktet upptar minst 30 % av bilden.
- Neutralt uttryck. Ett avslappnat eller lätt trevligt ansikte ger modellen störst flexibilitet.
- Ren bakgrund. Hög kontrast mellan motiv och bakgrund hjälper modellen att isolera identiteten.
- Skarp upplösning. 1024x1024 eller större. Ingen rörelseoskärpa.
Har du inget foto? Generera ett
Om du behöver ett referensfoto som du inte redan har, till exempel för en virtuell talesperson, en persona eller en karaktär, använder du Seedream för att generera ett. Skriv en prompt som "professional headshot of [beskrivning], soft studio lighting, neutral background, looking at camera" och välj det renaste resultatet.
Format
Både JPEG och PNG fungerar. Genomskinliga bakgrunder är acceptabla. Plattformen tar emot foton på upp till flera megabyte.
Steg 2: Förbered rent ljud
Ditt ljud styr läppsynkroniseringen, ansiktsuttrycket och gesturmönstret. Ju renare ljud, desto mer har modellen att arbeta med.
Inspelningsalternativ
Spela in själv. Ett tyst rum och en hygglig USB-mikrofon ger ljud som är tillräckligt rent för OmniHuman. Tala i naturlig takt med naturliga pauser. Överbetona inte.
Använd en TTS-tjänst. Alla kvalitativa text-till-tal-verktyg fungerar, till exempel ElevenLabs, Play.ht, Google eller Amazon Polly. Exportera i 44,1 kHz eller 48 kHz mono eller stereo.
Extrahera från befintligt ljud. Ett poddavsnitt, ett webbinarklipp eller en röstinspelning fungerar alla, förutsatt att talet är isolerat.
Dos and don'ts för ljud
- Gör klipp bort inledande och avslutande tystnad
- Gör normalisera ljudnivåerna för att undvika klippning
- Gör inte lämna musik eller kraftigt bakgrundsljud i mixen
- Gör inte använd inspelningar med mycket rumsklangt
- Gör inte överskrida tidsgränsen: 60s för 720p, 30s för 1080p
Steg 3: Skriv en scenprompt som hjälper
Scenprompten beskriver den visuella miljön runt din presentatör. Den beskriver inte personen, det gör modellen utifrån fotot.
Bra promptstruktur
En stark prompt innehåller fyra element:
- Bakgrund - var befinner sig personen?
- Ljussättning - hur är scenen belyst?
- Bildutsnitt - hur nära är kameran?
- Stil - några anteckningar om ton eller finish?
Exempelprompts som fungerar
Modernt kontorslandskap med stora fönster, mjukt naturligt ljus från vänster, medium närbild med huvud och axlar, professionell sändningsstil.
Minimalistisk studiomiljö med mjuk gradientbakgrund, jämn studiobelysning, halvbild, rent och modernt utseende.
Varmt hemmakontor med bokhyllor i bakgrunden, gyllene eftermiddagsljus, medium närbild, naturlig och tillgänglig ton.
Vad du bör undvika i promptar
- Beskriv inte personen (hårfärg, ålder, outfit), det sköter fotot
- Motsäg inte fotot (skriv inte "vit bakgrund" om fotot har svart bakgrund, om du inte verkligen vill att modellen ska ersätta den)
- Använd inte vaga fraser som "bra belysning", välj en specifik ljuskälla
- Överlasta inte prompten med mer än fem eller sex detaljer
Steg 4: Ladda upp och konfigurera
Öppna arteza.ai och välj OmniHuman v1.5, eller gå direkt till modellsida.
Uppladdningsordning
- Referensfoto - dra porträttet till bildplatsen
- Ljudfil - släpp talfilen i ljudplatsen
- Scenprompt - klistra in din scenbeskrivning
Konfigurera inställningarna
- Upplösning: 720p för utkast eller klipp längre än 30s, 1080p för professionella slutleveranser
- Turboläge: på vid iteration, av för slutkvalitet
- Granska creditkostnad: gränssnittet bekräftar den exakta creditkostnaden innan du genererar
Steg 5: Generera och granska
Klicka på generera. Standardläget tar flera minuter. Turboläget är snabbare. Du får ett meddelande när videon är klar.
Granska resultatet
Spela upp videon i full storlek och kontrollera dessa fyra saker:
- Läppsynkronisering - matchar munrörelserna fonemerna?
- Identitet - ser ansiktet ut som referensen genom hela videon?
- Gesturernas naturlighet - känns rörelsen organisk och inte robotaktig?
- Bakgrundskonsistens - matchar scenen din prompt?
Om något av dessa känns fel är lösningen nästan alltid i indata, inte att köra om. Byt foto, rensa ljudet eller strama åt prompten.
Redo att prova OmniHuman v1.5? Börja skapa gratis →

Vill du ha en presentatör som den här? Prova OmniHuman gratis →
Avancerade tips från riktiga produktionsflöden
Använd turboläge för utforskning, standardläge för slutversioner
Turboläget kostar lika mycket som standardläget för samma ljud, men det kortar väntetiden. Använd det för att snabbt testa olika promptar eller ljudtagningar, och rendera sedan den slutliga versionen i standardläge.
Matcha ljudets känsla med referensuttrycket
Om ditt foto visar ett neutralt ansikte men ditt ljud är mycket animerat kommer modellen att generera mycket rörelse. Om ljudet är lugnt och fotot visar ett leende kan du förvänta dig subtila variationer. Matcha dem för förutsägbara resultat.
Dela upp långt innehåll i segment
Behöver du en 90-sekunders video? Dela upp ljudet i två segment (t.ex. 45s vardera), generera två 720p-klipp och sätt ihop dem i valfritt videoredigeringsprogram. Identiteten förblir konsekvent eftersom du använder samma referensfoto.
Förbered flera foton av samma person
Att ha tre eller fyra referensfoton av samma person, med olika kläder, olika ljussättning och olika uttryck, låter dig matcha fotot mot innehållets ton. En varm anekdot får ett varmare foto, en företagsuppdatering får porträttbilden.
Bygg ett promptbibliotek
Spara scenpromptar som fungerade. "Minimalistisk studiogradient" eller "modernt kontorsfönsterljus" kan återanvändas i olika projekt för visuell enhetlighet.
Vanliga misstag och hur du åtgärdar dem
Läppsynkroniseringen känns lite fel
- Kontrollera ljudkvaliteten. Brus, komprimeringsartefakter eller låg bithastighet försämrar foneminläsningen
- Kontrollera längden. Klipp som är exakt vid gränsen kan bli avklippta på sista bildrutan, sikta på en sekund under gränsen
- Prova en renare inspelning eller exportera på högre bithastighet
Ansiktet ser "plastigt" eller alltför slätt ut
- Använd ett foto med högre upplösning. Indata under 512px ger mjukt resultat
- Justera promptens belysning till "naturlig" i stället för "studio" för mer textur
Gesturerna ser alltför subtila ut
- Använd mer uttrycksfullt ljud. Monotont tal ger minimal gesturvariation
- Välj ett foto med något öppnare hållning i stället för stel frontalinramning
Bakgrunden matchar inte prompten
- Var mer specifik. "Kontor" är vagt; "modernt kontor med en bokhylla bakom motivet och ett stort fönster till vänster" är konkret
- Matcha fotots kontext. Modellen väger in fotots bakgrund som referens
Kostnadsberäkning för olika projekt
Varje OmniHuman v1.5-video kostar 3-72 credits ($0,30-$7,20). Så här ser det ut i praktiken:
| Projekt | Videor som behövs | Total kostnad |
|---|---|---|
| Enstaka LinkedIn-inlägg | 1 | $7.20 |
| Välkomstserie med fem videor | 5 | $36 |
| Kurs med tio lektioner | 10 | $72 |
| Veckouppdateringar under ett år | 52 | $499.20 |
Jämför det med HeyGens $24-$48 i månaden (även månader du inte skapar något) eller Synthesians $30-$90 i månaden. Vid låga och måttliga volymer sparar OmniHuman hundratals dollar per år. Se fullständig prisöversikt för alla nivåer.
Betala per video, inte per månad
En 30-sekunders talvideo kostar $7.20, i planer från $5 i månaden utan årsavtal. Månatliga credits förnyas varje faktureringsperiod. Påfyllnadscredits upphör aldrig.
Generera din första videoChecklista för din första video
- Porträttfoto, 1024x1024 eller större, bra belysning, neutralt uttryck
- Ren ljudfil, under 60 sekunder, ingen musik eller klang
- Scenprompt med bakgrund, ljussättning, bildutsnitt och stil
- Arteza-konto med minst 72 credits
- Val av upplösning (720p eller 1080p)
- Beslut om turboläge
- Öppna OmniHuman v1.5 och generera
När du har skickat din första talvideo kan du utforska teknisk guide för läppsynkronisering, guide för flerspråkiga arbetsflöden och användningsspecifika guider som nyhetsankare och företagsutbildning.
Redo att prova OmniHuman v1.5? Börja skapa gratis →
Prova OmniHuman v1.5 - Just nu
Ladda upp ditt referensfoto på skapa-sidan.
5 gratis generationer · Inget kreditkort krävs