Wie man KI-Talking-Head-Videos mit OmniHuman v1.5 erstellt
Eine Schritt-für-Schritt-Anleitung zur Erstellung professioneller KI-Talking-Head-Videos mit OmniHuman v1.5 auf Arteza. Lerne Fotoauswahl, Audiovorbereitung, Prompt-Erstellung und Optimierungstechniken für beste Ergebnisse.

Dein erstes OmniHuman v1.5 Talking-Head-Video ist in etwa zehn Minuten fertig, und kostet genau $0,30-$7,20. Dieses Tutorial zeigt dir jeden Schritt, jede Eingabeentscheidung und jeden Qualitätstrick, den wir beim Erstellen tausender Talking-Head-Videos auf der Plattform gelernt haben.
Kurzfassung
- Du brauchst ein Porträtfoto, eine Audiodatei und einen kurzen Szenen-Prompt
- Ein 30-Sekunden-Video kostet 72 Credits (~7,20 Dollar), ab Tarifen ab 5 Dollar pro Monat
- 720p für 60-Sekunden-Clips oder 1080p für 30-Sekunden-Clips wählen
- Gutes Foto + sauberes Audio + spezifischer Prompt = professionelles Ergebnis beim ersten Versuch
- Turbo-Modus für Iterationen, Standardmodus für Hauptinhalte
Was du vor dem Start brauchst
Drei Eingaben, keine Ausnahmen:
- Ein Porträtfoto, Kopf und Schultern, gut beleuchtet, mindestens 512x512 Pixel
- Eine Audiodatei, MP3, WAV oder M4A, klare Sprache, bis zu 60 Sekunden
- Ein Szenen-Prompt, eine kurze Beschreibung des Hintergrunds und der Beleuchtung
Dazu ein Arteza-Konto mit ausreichend Credits für deinen Clip: 2,4 Credits pro Sekunde Audio, also 46 für ein 30-Sekunden-Video. Neue Konten erhalten beim Anmelden 10 Gratis-Credits, die einen kurzen Testclip abdecken, und der 5-Dollar-Starter-Tarif deckt einen Monat mit vollen Längen ab.
Erstelle jetzt deinen KI-Präsentator
Verwandle ein Foto und Audio in ein lebensechtes Sprechvideo. 7,20 Dollar pro 30-Sekunden-Video, ab Tarifen ab 5 Dollar pro Monat.
OmniHuman kostenlos testen5 kostenlose Generierungen · Keine Kreditkarte erforderlich
Schritt 1: Das richtige Foto auswählen oder erstellen
Das Foto ist der mit Abstand wichtigste Qualitätshebel im gesamten Workflow. Gib dem Modell ein hervorragendes Foto und es liefert ein hervorragendes Video. Gib ihm einen schnellen Handyschnappschuss und das Ergebnis wird das widerspiegeln.
Was ein gutes Referenzfoto ausmacht
- Gleichmäßige Beleuchtung. Diffuses Tageslicht oder weiches Studiolicht. Keine harten Schatten im Gesicht.
- Klares Gesicht. Augen offen, kein Brillenglanz, keine Haare vor den Gesichtszügen, keine Hände in der Nähe des Gesichts.
- Richtige Bildausschnitt. Kopf und Schultern sichtbar. Das Gesicht nimmt mindestens 30 % des Bildausschnitts ein.
- Neutraler Ausdruck. Ein entspanntes oder leicht freundliches Gesicht gibt dem Modell die größte Flexibilität.
- Klarer Hintergrund. Hoher Kontrast zwischen Person und Hintergrund hilft dem Modell, die Identität zu isolieren.
- Scharfe Auflösung. 1024x1024 oder größer. Keine Bewegungsunschärfe.
Kein Foto vorhanden? Eins generieren
Wenn du ein Referenzfoto benötigst, das du noch nicht hast, für einen virtuellen Sprecher, eine Persona oder einen Charakter, nutze Seedream, um eines zu generieren. Prompt: "Professional headshot of [Beschreibung], soft studio lighting, neutral background, looking at camera" und wähle das sauberste Ergebnis.
Formate
JPEG und PNG funktionieren beide. Transparente Hintergründe sind akzeptabel. Die Plattform akzeptiert Fotos bis zu mehreren Megabyte.
Schritt 2: Sauberes Audio vorbereiten
Dein Audio bestimmt die Lippensynchronisation, den Gesichtsausdruck und das Gestikmuster. Je sauberer das Audio, desto mehr hat das Modell zum Arbeiten.
Aufnahmeoptionen
Selbst aufnehmen. Ein ruhiger Raum und ein ordentliches USB-Mikrofon erzeugen Audio, das sauber genug für OmniHuman ist. Sprich in natürlichem Tempo mit natürlichen Pausen. Nicht überdeutlich sprechen.
Einen TTS-Dienst nutzen. Jedes qualitativ hochwertige Text-zu-Sprache-Tool funktioniert, ElevenLabs, Play.ht, Google, Amazon Polly. Als 44,1 kHz oder 48 kHz Mono oder Stereo exportieren.
Aus vorhandenem Audio extrahieren. Ein Podcast-Segment, ein Webinar-Ausschnitt oder eine Voiceover-Aufnahme funktionieren alle, solange die Sprache isoliert ist.
Audio: Was tun und was lassen
- Tun: Stille am Anfang und Ende abschneiden
- Tun: Audiopegel normalisieren, um Clipping zu vermeiden
- Lassen: Musik oder starke Umgebungsgeräusche im Mix lassen
- Lassen: Hallreiche Raumaufnahmen verwenden
- Lassen: Die Maximaldauer überschreiten: 60 s bei 720p, 30 s bei 1080p
Schritt 3: Einen hilfreichen Szenen-Prompt schreiben
Der Szenen-Prompt beschreibt die visuelle Umgebung um deinen Präsentator. Er beschreibt nicht die Person, das bekommt das Modell vom Foto.
Gute Prompt-Struktur
Ein starker Prompt enthält vier Elemente:
- Hintergrund, wo befindet sich die Person?
- Beleuchtung, wie ist die Szene beleuchtet?
- Bildausschnitt, wie nah ist die Kamera?
- Stil, Hinweise zu Ton oder Finish?
Beispiel-Prompts, die funktionieren
Modernes Büro mit großen Fenstern, weiches natürliches Licht von links, mittlere Nahaufnahme von Kopf und Schultern, professioneller Broadcast-Stil.
Minimalistisches Studio-Setting mit weichem Verlaufshintergrund, gleichmäßiges Studiolicht, mittlere Einstellung, klares und zeitgemäßes Erscheinungsbild.
Gemütliches Homeoffice mit Bücherregalen im Hintergrund, goldenes Nachmittagslicht, mittlere Nahaufnahme, natürlicher und zugänglicher Ton.
Was in Prompts vermieden werden sollte
- Die Person nicht beschreiben (Haarfarbe, Alter, Outfit), das regelt das Foto
- Dem Foto nicht widersprechen (kein "weißer Hintergrund", wenn das Foto einen schwarzen Hintergrund hat, außer das Modell soll ihn wirklich ersetzen)
- Keine vagen Formulierungen wie "gute Beleuchtung", eine bestimmte Lichtquelle angeben
- Den Prompt nicht mit mehr als fünf oder sechs Details überladen
Schritt 4: Hochladen und konfigurieren
Öffne arteza.ai und wähle OmniHuman v1.5, oder gehe direkt zur Modellseite.
Reihenfolge beim Hochladen
- Referenzfoto, das Porträt in den Bild-Slot ziehen
- Audiodatei, die Sprachaufnahme in den Audio-Slot legen
- Szenen-Prompt, deine Szenenbeschreibung einfügen
Einstellungen konfigurieren
- Auflösung: 720p für Entwürfe oder Clips länger als 30 s, 1080p für professionelle Endrenderings
- Turbo-Modus: ein für Iterationen, aus für finale Qualität
- Credit-Kosten prüfen: Die Benutzeroberfläche bestätigt die genauen Credit-Kosten vor der Generierung
Schritt 5: Generieren und überprüfen
Auf "Generieren" klicken. Der Standardmodus dauert mehrere Minuten. Der Turbo-Modus ist schneller. Du erhältst eine Benachrichtigung, wenn das Video fertig ist.
Das Ergebnis überprüfen
Spiel das Video in voller Größe ab und prüfe diese vier Dinge:
- Lippensynchronisation, passen die Mundbewegungen zu den Phonemen?
- Identität, sieht das Gesicht während des gesamten Videos wie das Referenzfoto aus?
- Natürlichkeit der Gestik, wirkt die Bewegung organisch und nicht roboterhaft?
- Hintergrundkonsistenz, entspricht die Szene deinem Prompt?
Wenn etwas davon nicht stimmt, liegt die Lösung fast immer in den Eingaben und nicht in einem erneuten Generieren. Foto tauschen, Audio bereinigen oder den Prompt präzisieren.
Bereit, OmniHuman v1.5 auszuprobieren? Kostenlos loslegen →

Einen solchen Präsentator gewünscht? OmniHuman kostenlos testen →
Fortgeschrittene Tipps aus echten Produktions-Workflows
Turbo für die Erkundung, Standard für die Endversion
Der Turbo-Modus kostet dasselbe wie der Standardmodus für dasselbe Audio, verkürzt aber die Wartezeit. Damit lassen sich verschiedene Prompts oder Audio-Takes schnell testen, bevor die Endversion im Standardmodus gerendert wird.
Audio-Emotion mit dem Referenzausdruck abstimmen
Wenn das Foto ein neutrales Gesicht zeigt, das Audio aber sehr lebendig ist, generiert das Modell viel Bewegung. Wenn das Audio ruhig und das Foto lächelnd ist, sind subtile Variationen zu erwarten. Beides aufeinander abstimmen für vorhersehbare Ergebnisse.
Langen Inhalt in Segmente aufteilen
Du brauchst ein 90-Sekunden-Video? Das Audio in zwei Segmente aufteilen (z. B. je 45 s), zwei 720p-Clips generieren und diese in einem beliebigen Videoeditor zusammenfügen. Die Identität bleibt konsistent, weil dasselbe Referenzfoto verwendet wird.
Mehrere Fotos derselben Person bereithalten
Drei oder vier Referenzfotos derselben Person, verschiedene Outfits, verschiedene Beleuchtung, verschiedene Ausdrücke, ermöglichen es, das Foto dem Inhaltston anzupassen. Eine persönliche Anekdote bekommt ein wärmeres Foto, ein Unternehmens-Update das Headshot.
Eine Prompt-Bibliothek anlegen
Bewährte Szenen-Prompts speichern. "Minimalist studio gradient" oder "modern office window light" können für visuelle Konsistenz projektübergreifend wiederverwendet werden.
Häufige Fehler und wie man sie behebt
Lippensynchronisation fühlt sich leicht versetzt an
- Audioqualität prüfen. Rauschen, Kompressionsartefakte oder niedrige Bitrate beeinträchtigen die Phonemextraktion
- Dauer prüfen. Clips genau an der Grenze können beim letzten Frame abgeschnitten werden, eine Sekunde kürzer anstreben
- Eine sauberere Aufnahme versuchen oder mit höherer Bitrate neu exportieren
Gesicht wirkt "plastikartig" oder zu glatt
- Ein höher aufgelöstes Foto verwenden. Eingaben unter 512 px erzeugen weiches Ausgabematerial
- Prompt-Beleuchtung anpassen auf "natürlich" statt "Studio" für mehr Textur
Gestik wirkt zu subtil
- Ausdrucksstärkeres Audio verwenden. Monotone Sprache erzeugt minimale Gestikvariation
- Ein Foto mit leicht offener Körperhaltung wählen statt steifer Frontalaufnahme
Hintergrund passt nicht zum Prompt
- Spezifischer sein. "Büro" ist vage; "modernes Büro mit einem Bücherregal hinter der Person und einem großen Fenster auf der linken Seite" ist umsetzbar
- Fotokontext berücksichtigen. Das Modell wertet den Fotohintergrund als Referenz
Kostenrechnung für verschiedene Projekte
Jedes OmniHuman v1.5 Video kostet 3-72 Credits ($0,30-$7,20). So sieht das in der Praxis aus:
| Projekt | Benötigte Videos | Gesamtkosten |
|---|---|---|
| Einzelner LinkedIn-Beitrag | 1 | 7,20 Dollar |
| Fünfteilige Willkommensserie | 5 | 36 Dollar |
| Zehnstündiger Kurs | 10 | 72 Dollar |
| Wöchentliche Updates für ein Jahr | 52 | 499,20 Dollar |
Im Vergleich dazu: HeyGen kostet 24-48 Dollar pro Monat (auch in Monaten, in denen nichts erstellt wird) oder Synthesia 30-90 Dollar pro Monat. Bei niedrigem und mittlerem Volumen spart OmniHuman hunderte Dollar pro Jahr. Alle Tarife findest du unter vollständige Preisübersicht.
Pro Video bezahlen, nicht pro Monat
Ein 30-Sekunden-Talking-Head-Video kostet 7,20 Dollar, ab Tarifen ab 5 Dollar pro Monat ohne Jahresvertrag. Monatliche Credits werden mit jedem Abrechnungszeitraum erneuert. Aufgeladene Credits verfallen nicht.
Erstes Video generierenCheckliste für dein erstes Video
- Porträtfoto, 1024x1024 oder größer, gut beleuchtet, neutraler Ausdruck
- Saubere Audiodatei, unter 60 Sekunden, keine Musik oder Hall
- Szenen-Prompt mit Hintergrund, Beleuchtung, Bildausschnitt und Stil
- Arteza-Konto mit mindestens 72 Credits
- Auflösungswahl (720p oder 1080p)
- Entscheidung für oder gegen Turbo-Modus
- OmniHuman v1.5 öffnen und generieren
Nachdem du dein erstes Talking-Head-Video erstellt hast, erkunde die technischer Leitfaden zur Lippensynchronisation, die Leitfaden für mehrsprachige Workflows sowie anwendungsspezifische Tutorials wie Nachrichtensprecher und betriebliche Schulungen.
Bereit, OmniHuman v1.5 auszuprobieren? Kostenlos loslegen →
OmniHuman v1.5 ausprobieren - Jetzt!
Lade dein Referenzbild auf der Erstellungsseite hoch.
5 kostenlose Generierungen · Keine Kreditkarte erforderlich