Wie man AI-Talking-Head-Videos mit OmniHuman v1.5 erstellt
Eine Schritt-für-Schritt-Anleitung zum Erstellen professioneller AI-Talking-Head-Videos mit OmniHuman v1.5 auf Arteza. Erfahren Sie mehr über Fotoauswahl, Audiovorbereitung, Prompt-Erstellung und Optimierungstechniken für die besten Ergebnisse.

Dein erstes OmniHuman v1.5 Talking-Head-Video dauert von Anfang bis Ende etwa zehn Minuten und kostet genau $9,60. Dieses Tutorial zeigt dir jeden Schritt, jede Input-Entscheidung und jeden Qualitätstrick, den wir aus der Generierung von Tausenden von Talking-Head-Videos auf der Plattform gelernt haben.
TL;DR
- Du benötigst ein Porträtfoto, eine Audiodatei und eine kurze Szenenbeschreibung
- Jede Generierung kostet 960 Credits (~$9,60) - günstige Abopläne
- Wähle 720p für 60-Sekunden-Clips oder 1080p für 30-Sekunden-Clips
- Gutes Foto + sauberes Audio + spezifische Anweisung = professionelles Ergebnis beim ersten Versuch
- Turbo-Modus zum Iterieren, Standard-Modus für Hero-Content
Was du brauchst, bevor du anfängst
Drei Inputs, keine Ausnahmen:
- Ein Porträtfoto - Kopf und Schultern, gut beleuchtet, mindestens 512x512 Pixel
- Eine Audiodatei - MP3, WAV oder M4A, saubere Sprache, bis zu 60 Sekunden
- Eine Szenenbeschreibung - eine kurze Beschreibung des Hintergrundes und der Beleuchtung
Plus ein Arteza-Konto mit mindestens 960 Credits. Neue Konten erhalten 50 kostenlose Credits bei der Registrierung, aber ein Talking Head kostet 960, daher benötigst du mindestens ein Starter-Paket für $10, um dein erstes Video zu erstellen.
Erstelle jetzt deinen KI-Moderator
Verwandle ein Foto + Audio in ein realistisches Talking-Video. $9,60 pro Video, günstige Abopläne.
OmniHuman kostenlos testen5 kostenlose Generierungen · Keine Kreditkarte erforderlich
Schritt 1: Wähle oder erstelle das richtige Foto
Das Foto ist der wichtigste Qualitätshebel im gesamten Workflow. Gib dem Modell ein großartiges Foto und es wird ein großartiges Video zurückgeben. Gib ihm einen hastigen Handyschuss und die Ausgabe wird das widerspiegeln.
Was macht ein großartiges Referenzfoto aus
- Gleichmäßige Beleuchtung. Diffuses Tageslicht oder weiches Studiolicht. Keine harten Schatten im Gesicht.
- Klares Gesicht. Augen offen, keine Blendung durch Brillen, kein Haar, das Merkmale verdeckt, keine Hände im Gesicht.
- Richtige Bildkomposition. Kopf und Schultern sichtbar. Das Gesicht nimmt mindestens 30% des Bildes ein.
- Neutrale Mimik. Ein entspanntes oder leicht angenehmes Gesicht gibt dem Modell die meiste Flexibilität.
- Sauberer Hintergrund. Hoher Kontrast zwischen Motiv und Hintergrund hilft dem Modell, die Identität zu isolieren.
- Scharfe Auflösung. 1024x1024 oder größer. Keine Bewegungsunschärfe.
Du hast kein Foto? Generiere eines
Wenn du kein Referenzfoto brauchst, das du bereits hast - für einen virtuellen Sprecher, eine Persona oder einen Charakter - verwende Seedream, um eines zu generieren. Fordere an: "professioneller Kopfschuss von [Beschreibung], weiches Studiolicht, neutraler Hintergrund, blickt in die Kamera" und wähle das sauberste Ergebnis.
Formate
JPEG und PNG funktionieren beide. Transparente Hintergründe sind akzeptabel. Die Plattform akzeptiert Fotos bis zu mehreren Megabyte.
Schritt 2: Bereite sauberes Audio vor
Dein Audio bestimmt die Lippensynchronisation, die Gesichtsausdrücke und das Gestenmuster. Je sauberer das Audio, desto mehr Material hat das Modell zum Arbeiten.
Aufnahmeoptionen
Nimm dich selbst auf. Ein ruhiges Zimmer und ein anständiges USB-Mikrofon produzieren Audio, das sauber genug für OmniHuman ist. Sprich in einem natürlichen Tempo mit natürlichen Pausen. Überartikuliere nicht.
Verwende einen TTS-Service. Jedes hochwertige Text-to-Speech-Tool funktioniert - ElevenLabs, Play.ht, Google, Amazon Polly. Exportiere mit 44,1 kHz oder 48 kHz Mono oder Stereo.
Extrahiere aus bestehendem Audio. Ein Podcast-Segment, ein Webinar-Clip oder eine Voice-Over-Aufnahme funktionieren alle, solange die Sprache isoliert ist.
Audio Dos und Don'ts
- Do führende und nachfolgende Stille entfernen
- Do normalisiere Audio-Pegel, um Clipping zu verhindern
- Don't belasse Musik oder starke Umgebungsgeräusche im Mix
- Don't verwende Hall-lastige Raumaufnahmen
- Don't überschreite das Dauer-Limit: 60s für 720p, 30s für 1080p
Schritt 3: Schreibe eine Szenenbeschreibung, die hilft
Die Szenenbeschreibung beschreibt die visuelle Umgebung um deinen Moderator herum. Sie beschreibt nicht die Person - das Modell bekommt das vom Foto.
Gute Prompt-Struktur
Ein starker Prompt enthält vier Elemente:
- Hintergrund - wo befindet sich die Person?
- Beleuchtung - wie ist die Szene beleuchtet?
- Bildkomposition - wie nah ist die Kamera?
- Stil - irgendwelche Anmerkungen zum Ton oder Finish?
Beispiel-Prompts, die funktionieren
Modernes Büro mit großen Fenstern, weiches Tageslicht von links, mittlere Nahaufnahme Kopf und Schultern, professioneller Broadcast-Stil.
Minimalistisches Studioumfeld mit sanftem Gradient-Hintergrund, gleichmäßiges Studiолicht, mittlere Einstellung, sauberer und zeitgenössischer Look.
Gemütliches Heimbüro mit Bücherregalen im Hintergrund, goldenes Nachmittagssonnenlicht, mittlere Nahaufnahme, natürlicher und ansprechender Ton.
Was du in Prompts vermeiden solltest
- Beschreibe nicht die Person (Haarfarbe, Alter, Outfit) - das Foto kümmert sich darum
- Widerspreche nicht dem Foto (kein "weißer Hintergrund", wenn das Foto einen schwarzen Hintergrund hat, es sei denn, du möchtest wirklich, dass das Modell ihn ersetzt)
- Verwende keine vagen Phrasen wie "gute Beleuchtung" - wähle eine bestimmte Lichtquelle
- Überlade den Prompt nicht mit mehr als fünf oder sechs Details
Schritt 4: Hochladen und Konfigurieren
Öffne arteza.ai und wähle OmniHuman v1.5, oder gehe direkt zu Modellseite.
Upload-Reihenfolge
- Referenzfoto - ziehe das Porträt in den Bildslot
- Audiodatei - lege die Sprachdatei in den Audio-Slot
- Szenenbeschreibung - füge deine Szenenbeschreibung ein
Konfiguriere die Einstellungen
- Auflösung: 720p für Entwürfe oder Clips länger als 30s, 1080p für professionelle Endergebnisse
- Turbo-Modus: aktiviert zum Iterieren, deaktiviert für höchste Qualität
- Kredite überprüfen: die Benutzeroberfläche bestätigt 960 Credits vor der Generierung
Schritt 5: Generiere und überprüfe
Klicke auf Generieren. Standard-Modus dauert mehrere Minuten. Turbo-Modus ist schneller. Du erhältst eine Benachrichtigung, wenn das Video bereit ist.
Überprüfe die Ausgabe
Spiele das Video in voller Größe ab und überprüfe diese vier Dinge:
- Lippensynchronisation - stimmen Mundbewegungen mit den Phonemen überein?
- Identität - sieht das Gesicht durchgehend wie das Referenzbild aus?
- Gesturen-Natürlichkeit - wirken Bewegungen organisch, nicht roboterhaft?
- Hintergrund-Konsistenz - passt die Szene zu deinem Prompt?
Wenn sich etwas davon falsch anfühlt, liegt die Lösung fast immer bei den Inputs, nicht bei einem Neustart. Wechsle das Foto, bereinige das Audio oder verfeinere den Prompt.
Bereit, OmniHuman v1.5 zu versuchen? Kostenlos erstellen →

Möchtest du einen Moderator wie diesen? OmniHuman kostenlos testen →
Fortgeschrittene Tipps aus echten Produktions-Workflows
Verwende Turbo zum Erkunden, Standard für Finales
Der Turbo-Modus kostet zwar immer noch 960 Credits pro Generierung, aber verkürzt die Wartezeit. Nutze ihn, um schnell verschiedene Prompts oder Audio-Takes zu testen, dann rendere die finale Version im Standard-Modus.
Ordne Audio-Emotion dem Referenz-Ausdruck zu
Wenn dein Foto ein neutrales Gesicht zeigt, aber dein Audio ist stark animiert, wird das Modell viele Bewegungen generieren. Wenn das Audio ruhig und das Foto lächelnd ist, erwarte subtile Variation. Koordiniere sie für vorhersehbare Ergebnisse.
Teile lange Inhalte in Segmente auf
Brauchst du ein 90-Sekunden-Video? Teile das Audio in zwei Segmente (z. B. 45s je), generiere zwei 720p-Clips und klebe sie in jedem Video-Editor zusammen. Die Identität bleibt konsistent, weil du das gleiche Referenzfoto verwendest.
Bereite mehrere Fotos für die gleiche Person vor
Mehrere Referenzfotos der gleichen Person zu haben - unterschiedliche Outfits, unterschiedliche Beleuchtung, unterschiedliche Ausdrücke - ermöglicht es dir, das Foto an den Content-Ton anzupassen. Eine warme Anekdote bekommt ein wärmeres Foto; ein Unternehmensupdate bekommt das Porträt.
Führe eine Prompt-Bibliothek
Speichere Szenenprompts, die funktioniert haben. "Minimalistischer Studio-Gradient" oder "modernes Bürofenster-Licht" können über Projekte hinweg für visuelle Konsistenz wiederverwendet werden.
Häufige Fehler und wie man sie behebt
Lippensynchronisation fühlt sich etwas falsch an
- Überprüfe die Audioqualität. Rauschen, Kompression-Artefakte oder niedrige Bitrate schaden der Phonemextraktion
- Überprüfe die Dauer. Clips genau am Limit können beim letzten Frame abgeschnitten werden - zielen auf eine Sekunde darunter ab
- Versuche eine sauberere Aufnahme oder exportiere mit höherer Bitrate neu
Gesicht sieht "plastisch" oder zu glatt aus
- Verwende ein höherauflösendes Foto. Input unter 512px produziert weiches Output
- Passe die Prompt-Beleuchtung an auf "natürlich" statt "Studio" für mehr Textur
Gesten sehen zu subtil aus
- Verwende ausdrucksvolleres Audio. Monotone Sprache produziert minimale Gestenvariationen
- Wähle ein Foto mit leicht offener Körperhaltung statt starre frontale Bildkomposition
Hintergrund passt nicht zum Prompt
- Sei spezifischer. "Büro" ist vage; "modernes Büro mit einem Regal hinter dem Motiv und einem großen Fenster auf der linken Seite" ist umsetzbar
- Passe zum Fotokontext. Das Modell gewichtet den Foto-Hintergrund als Referenz
Kostenrechnung für verschiedene Projekte
Jedes OmniHuman v1.5 Video kostet 960 Credits (~$9,60). So sieht das in der Praxis aus:
| Projekt | Videos benötigt | Gesamtkosten |
|---|---|---|
| Ein einzelner LinkedIn-Beitrag | 1 | $9,60 |
| Fünf-Video-Willkommen-Serie | 5 | $48 |
| Zehn-Lektionen-Kurs | 10 | $96 |
| Wöchentliche Updates für ein Jahr | 52 | $499,20 |
Vergleich das mit HeyGens $24-$48 pro Monat (auch in Monaten, in denen du nichts erstellst) oder Synthesias $30-$90 pro Monat. Bei niedrigen bis mittleren Volumen spart OmniHuman Hunderte pro Jahr. Siehe die vollständige Preisaufschlüsselung für jede Stufe.
Zahle pro Video, nicht pro Monat
Jedes Talking Head ist $9,60 - günstige Abopläne zum Kündigen, kein monatliches Minimum. Monatliche Credits werden bei jedem Abrechnungszyklus aufgeladen. Top-up-Credits verfallen nie.
Generiere dein erstes VideoDeine Erste-Video-Checkliste
- Porträtfoto, 1024x1024 oder größer, gut beleuchtet, neutraler Ausdruck
- Saubere Audiodatei, unter 60 Sekunden, keine Musik oder Hall
- Szenenbeschreibung mit Hintergrund, Beleuchtung, Bildkomposition, Stil
- Arteza-Konto mit mindestens 960 Credits
- Auflösungswahl (720p oder 1080p)
- Turbo-Modus-Entscheidung
- Öffne OmniHuman v1.5 und generiere
Nachdem du dein erstes Talking Head ausgeliefert hast, erkunde die Lip-Sync-Technikleitfaden, die Mehrsprachiger Workflow-Leitfaden und anwendungsspezifische Tutorials wie Nachrichtensprecher und Unternehmensschulung.
Bereit, OmniHuman v1.5 zu versuchen? Kostenlos erstellen →
Try OmniHuman v1.5 - Right Now
Upload your reference image on the create page.
5 free generations · No credit card needed