Jak tworzyć wideo z mówiącą głową AI za pomocą OmniHuman v1.5
Przewodnik krok po kroku dotyczący tworzenia profesjonalnych wideo z mówiącą głową AI przy użyciu OmniHuman v1.5 na Arteza. Dowiedz się, jak dobierać zdjęcia, przygotowywać audio, pisać prompty i optymalizować ustawienia, aby uzyskać najlepsze rezultaty.

Twój pierwszy film z mówiącą głową w OmniHuman v1.5 zajmuje około dziesięciu minut od początku do końca - i kosztuje dokładnie $0,30-$7,20. Ten poradnik pokazuje każdy krok, każdą decyzję dotyczącą danych wejściowych i każdą sztuczkę jakościową, którą poznaliśmy podczas generowania tysięcy filmów z mówiącą głową na platformie.
TL;DR
- Potrzebujesz jednego zdjęcia portretowego, jednego pliku audio i krótkiego opisu sceny
- 30-sekundowy film kosztuje 72 kredyty (~7,20 dolarów) - w planach od 5 dolarów miesięcznie
- Wybierz 720p dla klipów 60-sekundowych lub 1080p dla klipów 30-sekundowych
- Dobre zdjęcie + czyste audio + konkretny prompt = profesjonalny efekt za pierwszym razem
- Tryb Turbo do iteracji, tryb standardowy do kluczowych treści
Czego potrzebujesz przed rozpoczęciem
Trzy elementy wejściowe - bez wyjątków:
- Zdjęcie portretowe - głowa i ramiona, dobre oświetlenie, minimum 512x512 pikseli
- Plik audio - MP3, WAV lub M4A, czysta mowa, do 60 sekund
- Prompt sceny - krótki opis tła i oświetlenia
Potrzebujesz również konta Arteza z wystarczającą liczbą kredytów na swój klip: 2,4 kredytu za sekundę audio, czyli 46 kredytów za 30-sekundowy film. Nowe konta otrzymują 10 darmowych kredytów przy rejestracji, co wystarczy na krótki klip testowy, a plan Starter za 5 dolarów pokrywa miesiąc pełnowymiarowych filmów.
Stwórz swojego prezentera AI już teraz
Zamień jedno zdjęcie i plik audio w realistyczny film z mówiącą postacią. 7,20 dolarów za 30-sekundowy film w planach od 5 dolarów miesięcznie.
Wypróbuj OmniHuman za darmo5 bezpłatnych generacji · Bez wymaganej karty kredytowej
Krok 1: Wybierz lub stwórz odpowiednie zdjęcie
Zdjęcie to największa dźwignia jakości w całym procesie. Dostarcz modelowi świetne zdjęcie, a otrzymasz świetny film. Dostarcz naprędce zrobione zdjęcie telefonem, a efekt będzie tego odzwierciedleniem.
Co tworzy dobre zdjęcie referencyjne
- Równomierne oświetlenie. Rozproszone światło naturalne lub miękkie światło studyjne. Żadnych ostrych cieni na twarzy.
- Wyraźna twarz. Otwarte oczy, brak refleksów na okularach, włosy nieosłaniające rysów twarzy, dłonie z dala od twarzy.
- Właściwe kadrowanie. Widoczna głowa i ramiona. Twarz zajmuje co najmniej 30% kadru.
- Neutralny wyraz twarzy. Zrelaksowana lub lekko przyjazna mina daje modelowi największą elastyczność.
- Czyste tło. Wysoki kontrast między obiektem a tłem pomaga modelowi wyodrębnić tożsamość.
- Ostra rozdzielczość. 1024x1024 lub więcej. Żadnego rozmycia ruchu.
Nie masz zdjęcia? Wygeneruj je
Jeśli potrzebujesz zdjęcia referencyjnego, którego jeszcze nie masz - do wirtualnego rzecznika, persony lub postaci - użyj Seedream, aby je wygenerować. Wpisz prompt: "profesjonalne zdjęcie portretowe [opis], miękkie oświetlenie studyjne, neutralne tło, patrzący w aparat" i wybierz najlepszy efekt.
Formaty
JPEG i PNG działają oba. Przezroczyste tła są akceptowane. Platforma przyjmuje zdjęcia do kilku megabajtów.
Krok 2: Przygotuj czyste audio
Twoje audio określa synchronizację ust, wyrazy twarzy i wzorzec gestów. Im czystsze audio, tym więcej materiału ma do pracy model.
Opcje nagrywania
Nagraj siebie. Cicha sala i przyzwoity mikrofon USB dadzą audio wystarczająco czyste dla OmniHuman. Mów w naturalnym tempie, z naturalnymi pauzami. Nie przesadzaj z wymową.
Użyj usługi TTS. Działa każde narzędzie text-to-speech dobrej jakości - ElevenLabs, Play.ht, Google, Amazon Polly. Eksportuj w 44,1kHz lub 48kHz mono lub stereo.
Wyodrębnij z istniejącego audio. Fragment podcastu, klip z webinaru lub nagranie lektora - wszystko to działa, o ile mowa jest wyizolowana.
Co robić, a czego nie robić z audio
- Rób przycinanie wiodącej i końcowej ciszy
- Rób normalizację poziomów audio, aby zapobiec przesterowaniu
- Nie pozostawiaj muzyki ani głośnych dźwięków otoczenia w miksie
- Nie używaj nagrań z pomieszczenia z dużym pogłosem
- Nie przekraczaj limitu czasu: 60s dla 720p, 30s dla 1080p
Krok 3: Napisz pomocny prompt sceny
Prompt sceny opisuje wizualne otoczenie wokół prezentera. Nie opisuje osoby - model pobiera tę informację ze zdjęcia.
Dobra struktura promptu
Mocny prompt zawiera cztery elementy:
- Tło - gdzie jest ta osoba?
- Oświetlenie - jak oświetlona jest scena?
- Kadrowanie - jak blisko jest kamera?
- Styl - uwagi dotyczące tonu lub wykończenia?
Przykładowe prompty, które działają
Nowoczesne biuro korporacyjne z dużymi oknami, miękkie naturalne światło z lewej strony, kadrowanie medium close-up obejmujące głowę i ramiona, profesjonalny styl broadcastowy.
Minimalistyczne studio z miękkim gradientowym tłem, równomierne oświetlenie studyjne, ujęcie średnie, czysty i nowoczesny wygląd.
Ciepłe domowe biuro z regałami na książki w tle, złote światło popołudniowego słońca, kadrowanie medium close-up, naturalny i przystępny ton.
Czego unikać w promptach
- Nie opisuj osoby (kolor włosów, wiek, strój) - to zadanie zdjęcia
- Nie zaprzeczaj zdjęciu (żadnego "białego tła", jeśli zdjęcie ma czarne tło, chyba że naprawdę chcesz, aby model je zastąpił)
- Nie używaj niejasnych wyrażeń jak "dobre oświetlenie" - wskaż konkretne źródło światła
- Nie przeciążaj promptu więcej niż pięcioma lub sześcioma szczegółami
Krok 4: Prześlij pliki i skonfiguruj ustawienia
Otwórz arteza.ai i wybierz OmniHuman v1.5 lub przejdź bezpośrednio do strona modelu.
Kolejność przesyłania
- Zdjęcie referencyjne - przeciągnij portret do slotu na zdjęcie
- Plik audio - upuść plik mowy do slotu na audio
- Prompt sceny - wklej opis sceny
Skonfiguruj ustawienia
- Rozdzielczość: 720p dla wersji roboczych lub klipów dłuższych niż 30s, 1080p dla profesjonalnych finalnych renderów
- Tryb Turbo: włączony do iteracji, wyłączony dla finalnej jakości
- Sprawdź koszt kredytów: interfejs potwierdzi dokładny koszt kredytów przed generowaniem
Krok 5: Generuj i oceniaj efekty
Kliknij generuj. Tryb standardowy trwa kilka minut. Tryb Turbo jest szybszy. Otrzymasz powiadomienie, gdy film będzie gotowy.
Ocenianie efektów
Odtwórz film w pełnym rozmiarze i sprawdź te cztery rzeczy:
- Synchronizacja ust - czy kształty ust odpowiadają fonemom?
- Tożsamość - czy twarz przez cały czas wygląda jak na zdjęciu referencyjnym?
- Naturalność gestów - czy ruch wygląda organicznie, a nie robotycznie?
- Spójność tła - czy scena odpowiada promptowi?
Jeśli którykolwiek z tych elementów jest nie tak, rozwiązanie prawie zawsze leży w danych wejściowych, a nie w ponownym generowaniu. Zmień zdjęcie, wyczyść audio lub doprecyzuj prompt.
Gotowy, aby wypróbować OmniHuman v1.5? Zacznij tworzyć za darmo →

Chcesz takiego prezentera? Wypróbuj OmniHuman za darmo →
Zaawansowane wskazówki z prawdziwych procesów produkcyjnych
Tryb Turbo do eksploracji, tryb standardowy do finałów
Tryb Turbo kosztuje tyle samo co tryb standardowy przy tym samym audio, ale skraca czas oczekiwania. Używaj go do szybkiego testowania różnych promptów lub wersji audio, a następnie renderuj finalną wersję w trybie standardowym.
Dopasuj emocje audio do wyrazu twarzy na zdjęciu
Jeśli Twoje zdjęcie pokazuje neutralną twarz, a audio jest bardzo ożywione, model wygeneruje dużo ruchu. Jeśli audio jest spokojne, a zdjęcie przedstawia uśmiech, spodziewaj się subtelnych zmian. Dopasuj je do siebie, aby uzyskać przewidywalne efekty.
Podziel długie treści na segmenty
Potrzebujesz 90-sekundowego filmu? Podziel audio na dwa segmenty (np. po 45s każdy), wygeneruj dwa klipy 720p i połącz je w dowolnym edytorze wideo. Tożsamość pozostaje spójna, ponieważ używasz tego samego zdjęcia referencyjnego.
Przygotuj kilka zdjęć tej samej osoby
Posiadanie trzech lub czterech zdjęć referencyjnych tej samej osoby - w różnych strojach, przy różnym oświetleniu, z różnymi wyrazami twarzy - pozwala dopasować zdjęcie do tonu treści. Ciepła anegdota dostaje cieplejsze zdjęcie; aktualizacja korporacyjna dostaje formalne zdjęcie portretowe.
Prowadź bibliotekę promptów
Zapisuj prompty scen, które zadziałały. "Minimalistyczny gradient studyjny" lub "nowoczesne biuro z oknem" można ponownie wykorzystywać w różnych projektach dla wizualnej spójności.
Najczęstsze błędy i sposoby ich naprawy
Synchronizacja ust jest lekko niedopasowana
- Sprawdź jakość audio. Szumy, artefakty kompresji lub niskie bitrate pogarszają ekstrakcję fonemów
- Sprawdź czas trwania. Klipy dokładnie na granicy limitu mogą zostać ucięte na ostatniej klatce - celuj o sekundę krócej
- Wypróbuj czystsze nagranie lub ponownie wyeksportuj przy wyższym bitrate
Twarz wygląda "plastycznie" lub zbyt gładko
- Użyj zdjęcia o wyższej rozdzielczości. Wejście poniżej 512px daje miękki efekt wyjściowy
- Dostosuj oświetlenie w promptcie na "naturalne" zamiast "studyjnego", aby uzyskać więcej faktury
Gesty wyglądają zbyt subtelnie
- Użyj bardziej ekspresywnego audio. Monotonna mowa powoduje minimalne zróżnicowanie gestów
- Wybierz zdjęcie z lekko otwartą postawą zamiast sztywnego, frontalnego kadru
Tło nie odpowiada promptowi
- Bądź bardziej konkretny. "Biuro" to za mało; "nowoczesne biuro z regałem za obiektem i dużym oknem po lewej stronie" to coś, z czym można pracować
- Dopasuj kontekst zdjęcia. Model uwzględnia tło zdjęcia jako punkt odniesienia
Koszty dla różnych projektów
Każdy film OmniHuman v1.5 kosztuje 3-72 kredytów ($0,30-$7,20). Oto jak to wygląda w praktyce:
| Projekt | Liczba filmów | Łączny koszt |
|---|---|---|
| Pojedynczy post na LinkedIn | 1 | $7,20 |
| Pięcioodcinkowa seria powitalna | 5 | $36 |
| Kurs z dziesięcioma lekcjami | 10 | $72 |
| Cotygodniowe aktualizacje przez rok | 52 | $499,20 |
Porównaj to z HeyGen w cenie 24-48 dolarów miesięcznie (nawet w miesiącach, gdy nic nie tworzysz) lub Synthesia w cenie 30-90 dolarów miesięcznie. Przy niskich i średnich wolumenach OmniHuman oszczędza setki dolarów rocznie. Zobacz pełne zestawienie cen, aby poznać każdy poziom.
Płać za film, nie za miesiąc
30-sekundowa mówiąca głowa kosztuje 7,20 dolarów, w planach od 5 dolarów miesięcznie bez rocznej umowy. Miesięczne kredyty odnawiają się w każdym cyklu rozliczeniowym. Kredyty doładowane nigdy nie wygasają.
Wygeneruj swój pierwszy filmLista kontrolna przed pierwszym filmem
- Zdjęcie portretowe, 1024x1024 lub większe, dobre oświetlenie, neutralny wyraz twarzy
- Czysty plik audio, poniżej 60 sekund, bez muzyki i pogłosu
- Prompt sceny z tłem, oświetleniem, kadrowaniem i stylem
- Konto Arteza z co najmniej 72 kredytami
- Wybór rozdzielczości (720p lub 1080p)
- Decyzja o trybie Turbo
- Otwórz OmniHuman v1.5 i generuj
Gdy wyślesz swój pierwszy film z mówiącą głową, odkryj przewodnik techniczny po synchronizacji ust, przewodnik po pracy wielojęzycznej i poradniki dla konkretnych zastosowań, takie jak prezenterzy wiadomości i szkolenia firmowe.
Gotowy, aby wypróbować OmniHuman v1.5? Zacznij tworzyć za darmo →
Wypróbuj OmniHuman v1.5 - Już teraz
Prześlij swój obraz referencyjny na stronie tworzenia.
5 bezpłatnych generacji · Bez wymaganej karty kredytowej