OmniHuman v1.5: Lebensechte KI-Avatare aus einem einzigen Foto erstellen
Der vollständige Leitfaden zu OmniHuman v1.5 auf Arteza. Erfahre, wie du realistische KI-Avatar-Videos aus einem einzigen Foto und einer Audiodatei erstellst, einschließlich Funktionen, Eingabeanforderungen, Preisen, Ausgabespezifikationen und Anwendungsfällen aus der Praxis.

Ein Foto. Eine Audiodatei. Ein realistisches Sprechvideo für 7,20 Dollar, mit Tarifen ab 5 Dollar pro Monat, ohne Kreditkartenbindung und ohne Jahresvertrag. Das ist das Versprechen von OmniHuman v1.5, und dieser Leitfaden zeigt dir genau, wie es eingelöst wird.
TL;DR
- Verwandle jedes Portraitfoto und eine Audiodatei in ein lebensechtes Sprechvideo
- 3-72 Credits ($0,30-$7,20) pro Generierung - zahle nur, wenn du etwas erstellst
- 720p bis zu 60 Sekunden oder 1080p bis zu 30 Sekunden
- Phonemgenaue Lippensynchronisation, natürliche Gesten, audiogesteuerte Mimik
- Ab 5 Dollar/Monat. Jederzeit kündbar, anders als HeyGen (24-48 Dollar/Monat) oder Synthesia (30-90 Dollar/Monat)
Was OmniHuman v1.5 eigentlich macht
OmniHuman v1.5 ist ByteDances wichtigstes Avatar-Modell, das ausschließlich auf Arteza verfügbar ist. Du lädst ein einzelnes Portraitfoto und eine Sprach-Audiodatei hoch, und das Modell generiert ein vollständiges Talking-Head-Video: Lippensynchronisation, Augenblinzeln, Kopfneigungen, Schulterbewegungen und Mikroausdrücke werden alle von Grund auf synthetisiert.
Das ist kein altes "animierten Mund auf ein statisches Gesicht kleben"-Prinzip. Jedes Bild wird neu von einem Diffusion-Transformer generiert, der sowohl Identität als auch Audio versteht. Die Person auf deinem Foto bewegt sich so, wie ein echter Mensch es täte, während sie genau dieses Audio wiedergibt.
Wenn du Seedance 2.0 für cinematische Videos oder Seedream für die Bildgenerierung verwendet hast, vervollständigt OmniHuman v1.5 das Set: Text zu Bild, Bild zu Video und jetzt Foto plus Audio zu Avatar.
Erstelle jetzt deinen KI-Präsentator
Verwandle ein Foto und Audio in ein lebensechtes Sprechvideo. 7,20 Dollar pro 30-Sekunden-Video mit Tarifen ab 5 Dollar pro Monat.
OmniHuman kostenlos testen5 kostenlose Generierungen · Keine Kreditkarte erforderlich
Die fünf Funktionen, die wirklich zählen
1. Lippensynchronisation auf Phonem-Ebene
Das Modell extrahiert Phoneme aus deinem Audio und ordnet sie Bild für Bild genauen Mundformen zu. Plosive wie "p" und "b" zeigen Lippenschluss. Frikative wie "f" und "v" zeigen Zähne auf der Lippe. Vokale erzeugen die passende Kieferöffnung. Zuschauer, die mit Ton schauen, werden das Modell nicht beim Täuschen erwischen.
2. Audiogesteuerte Gesichtsausdrücke
Wenn das Audio enthusiastisch klingt, heben sich die Augenbrauen. Bei einer Pause zur Betonung verengen sich die Augen leicht. Diese Signale werden aus der Vokalprosodie abgeleitet, nicht in starre Vorlagen eingebaut.
3. Natürliche Gestengenerierung
Schulterbewegungen, Kopfdrehungen und subtile Haltungsänderungen entstehen aus dem Sprachsignal selbst. Ein Sprecher, der einen Punkt macht, lehnt sich vor. Einer, der Punkte auflistet, verlagert sein Gewicht. Die Bewegung korreliert mit der Bedeutung, nicht mit einem Timer.
4. Turbo-Modus
Brauchst du Tempo für die Iteration? Der Turbo-Modus verkürzt die Generierungszeit, ohne die Kreditkosten zu ändern. Nutze ihn, um Prompts und Eingaben zu testen, und wechsle dann für das finale Rendering in den Standardmodus.
5. Zwei Auflösungen, zwei Laufzeiten
| Auflösung | Maximale Audiodauer | Am besten für |
|---|---|---|
| 720p (1280x720) | 60 Sekunden | Social-Clips, Training, Entwürfe |
| 1080p (1920x1080) | 30 Sekunden | Kundenprojekte, Produktdemos, Marketing |
Wie die Pipeline funktioniert
Das Verständnis der einzelnen Schritte hilft dir, dem Modell bessere Eingaben zu liefern.
Schritt 1: Identitätsextraktion. Ein Gesichtscodierer wandelt dein Foto in ein hochdimensionales Embedding um, das Knochenstruktur, Hautton, Augenform und Hunderte anderer Merkmale erfasst. Dieses Embedding hält das Gesicht über jeden Frame hinweg konsistent.
Schritt 2: Audioanalyse. Die Sprachspur wird auf Phoneme, Prosodie, Energiekontour und emotionalen Ton analysiert.
Schritt 3: Bewegungssynthese. Ein Bewegungsnetzwerk wandelt Audio-Features in framegenaue Parameter für Gesicht, Kopf und Schultern um.
Schritt 4: Diffusions-Rendering. Ein Transformer generiert die endgültigen Pixel und kombiniert dabei Identität, Bewegung und deine Prompt-Beschreibung der Szene.
Schritt 5: Zeitliche Kohärenz. Ein Verfeinerungsdurchgang beseitigt Flimmern, Ruckeln und Identitätsdrift zwischen den Frames.
Was du bereitstellen musst
Referenzfoto
- Auflösung: mindestens 512x512, idealerweise 1024x1024 oder höher
- Bildausschnitt: Kopf und Schultern, Gesicht mindestens 30% des Frames
- Beleuchtung: gleichmäßig und diffus schlägt harte Schatten jedes Mal
- Ausdruck: neutral oder leicht freundlich gibt dem Modell den meisten Spielraum
- Format: JPEG oder PNG
Audiodatei
- Format: MP3, WAV oder M4A
- Dauer: bis zu 60 Sek. bei 720p, bis zu 30 Sek. bei 1080p
- Qualität: saubere Sprache ohne Musikuntermalung, ohne starken Hall
- Sprache: jede gesprochene Sprache funktioniert
Textprompt
Beschreibe die Szene: Hintergrund ("modernes Büro mit großen Fenstern"), Beleuchtung ("weiches Hauptlicht von links"), Bildausschnitt ("Halbtotale, Kopf und Schultern") und etwaige Stilhinweise.
Preise: Die Pay-per-Use-Rechnung
OmniHuman v1.5 kostet 2,4 Credits pro Sekunde Audio: 72 Credits, also ungefähr 7,20 Dollar, für ein 30-Sekunden-Video zum Basistarif. Credits sind in einem monatlichen Plan ab 5 Dollar enthalten. Du abonnierst, gibst Credits beim Generieren aus, und das Guthaben wird jede Abrechnungsperiode erneuert.
| Monatlicher Plan | Preis | Credits | Effektive Kosten pro 30-Sekunden-Video |
|---|---|---|---|
| Starter | 5 Dollar/Monat | 60 | ca. 3,83 Dollar |
| Creator | 25 Dollar/Monat | 300 | ca. 3,83 Dollar |
| Pro | 50 Dollar/Monat | 700 | ca. 3,29 Dollar |
| Studio | 120 Dollar/Monat | 1.800 | ca. 3,07 Dollar |
Warum das besser als Abonnements ist
HeyGen beginnt bei 24 Dollar/Monat mit einem monatlichen Minutenkontingent. Synthesia beginnt bei 30 Dollar/Monat. D-ID beginnt bei 5 Dollar/Monat für ein kleines Kontingent und skaliert bis auf 300 Dollar/Monat.
Mit OmniHuman v1.5 zahlst du in Monaten, in denen du nichts erstellst, gar nichts. Mache ein 30-Sekunden-Video für 7,20 Dollar. Mache zehn für 72 Dollar. Mache keines und zahle nichts. Neue Konten erhalten außerdem 10 Gratiscredits bei der Anmeldung, um Seedream und Seedance 1.0 Lite vor dem Kauf auszuprobieren.
Die vollständige Aufschlüsselung findest du in unserem OmniHuman v1.5 Preisleitfaden.
Bereit, OmniHuman v1.5 auszuprobieren? Kostenlos loslegen →

Möchtest du einen solchen Präsentator? OmniHuman kostenlos testen →
Schritt für Schritt: Dein erstes Video in wenigen Minuten
- Foto vorbereiten. Wähle ein gut beleuchtetes Portrait oder generiere eines mit Seedream.
- Audio vorbereiten. Nimm dich selbst auf oder nutze ein beliebiges hochwertiges TTS. Schneide führende und abschließende Stille weg.
- Modell öffnen. Gehe zu arteza.ai und wähle OmniHuman v1.5, oder springe direkt zur Modellseite.
- Eingaben hochladen. Foto, Audio und ein kurzer Szenen-Prompt.
- Konfigurieren. Wähle 720p oder 1080p, aktiviere Turbo für mehr Tempo.
- Generieren. Nach einigen Minuten ist dein Video fertig.
- Überprüfen und herunterladen. MP4-Ausgabe, bereit für jeden Editor oder jede Plattform.
Eine ausführlichere Anleitung findest du unter Talking-Head-Tutorial.
Echte Anwendungsfälle, die sich lohnen
Unternehmensschulungen - Konsistente Präsentatorvideos ohne Drehterminen. Inhalte aktualisieren durch einfachen Audiotausch. Vollständiger Leitfaden.
E-Learning - Kursleiter können Lektionen in großem Maßstab veröffentlichen. Avatare halten die Aufmerksamkeit besser als statische Folien mit Sprachausgabe. Vollständiger Leitfaden.
Vertriebsakquise - Personalisierte Videonachrichten, die Interessenten namentlich ansprechen. Vollständiger Leitfaden.
Kundensupport - Videoantworten auf häufige Fragen lösen Probleme schneller als Hilfeartikel. Vollständiger Leitfaden.
YouTube und Podcasting - KI-Co-Hosts, Erklärsegmente und Videoversionen von Audiosendungen. Siehe YouTube- und Podcast-Leitfäden.
Gesundheitsbildung - Patientenerklärungen in jeder Sprache mit einem einzigen vertrauten Gesicht. Vollständiger Leitfaden.
Mehrsprachige Inhalte - Gleiches Foto, Audio tauschen, zehn Sprachversionen mit konsistenter Identität veröffentlichen. Vollständiger Leitfaden.
Tipps zur Verbesserung der Ausgabequalität
Fotoauswahl
- Gleichmäßige, weiche Beleuchtung ohne harte Schatten
- Frontale oder leichte Dreiviertel-Perspektive
- Hände nicht im Gesicht
- Klarer Hintergrund, der sich vom Motiv abhebt
Audiovorbereitung
- In einem ruhigen Raum mit minimalem Hall aufnehmen
- In natürlichem Tempo sprechen, echte Pausen einbauen
- Pegel normalisieren, um Clipping zu vermeiden
- Musik oder Umgebungsgeräusche vor dem Hochladen entfernen
Prompt-Erstellung
- Präzise sein: "modernes Büro mit großen Fenstern" schlägt "schöner Hintergrund"
- Beleuchtung benennen: "weiches Studio-Hauptlicht" oder "warme Nachmittagssonne"
- Bildausschnitt angeben: "nahe Halbtotale, Kopf und Schultern"
- Nicht dem Foto widersprechen (keine andere Haarfarbe beschreiben)
Iteration
- Turbo-Modus für Testläufe
- Jeweils nur eine Variable ändern
- Eine Datei mit funktionierenden Prompts führen
OmniHuman v1.5 im Vergleich zu den Alternativen
| Funktion | OmniHuman v1.5 | HeyGen | Synthesia | D-ID |
|---|---|---|---|---|
| Eigenes Foto als Eingabe | Ja | Eingeschränkt | Nein (voreingestellte Avatare) | Ja |
| Lippensync-Qualität | Ausgezeichnet | Gut | Gut | Mäßig |
| Gestengenerierung | Audiogesteuert | Vorlagenbasiert | Vorlagenbasiert | Eingeschränkt |
| Maximale Auflösung | 1080p | 1080p | 1080p | 1024x1024 |
| Preismodell | Pay-per-Use | Abonnement | Abonnement | Gemischt |
| Kosten pro Video | ca. 7,20 Dollar für 30 Sek. | 24-48 Dollar/Monat | 30-90 Dollar/Monat | 5-300 Dollar/Monat |
| Gratiscredits bei Anmeldung | 10 Credits | Eingeschränkte Testversion | Kostenlose Testversion | Eingeschränkte Testversion |
Direkte Vergleiche:
Umgehe die monatliche Abonnement-Falle
HeyGen, Synthesia und D-ID berechnen dir jeden Monat Gebühren, auch wenn du kein einziges Video erstellst. OmniHuman v1.5 berechnet 7,20 Dollar nur dann, wenn du etwas erstellst.
Dein erstes Video generierenEhrliche Einschränkungen
- Dauerbegrenzungen. 60 Sek. bei 720p, 30 Sek. bei 1080p. Längere Inhalte erfordern Zusammenfügen.
- Nur eine Person pro Video. Szenen mit mehreren Personen erfordern Compositing.
- Nur Oberkörper. Keine Ganzkörperanimation.
- Audioqualität ist entscheidend. Schlechte Eingabe ergibt schlechte Lippensynchronisation.
- Nicht in Echtzeit. Generierungen dauern Minuten, nicht Millisekunden.
- Kein Live-Streaming. Die Ausgabe ist ein vorgerendertes MP4.
Häufig gestellte Fragen
Kann ich ein beliebiges Foto verwenden?
Du kannst jedes Foto verwenden, das die Eingabeanforderungen erfüllt, bist aber für Rechte und Genehmigungen selbst verantwortlich. Artezas Nutzungsbedingungen regeln die rechtlichen Details.
Funktioniert es auch mit nicht englischsprachigem Audio?
Ja. Jede gesprochene Sprache funktioniert, mit der höchsten Genauigkeit bei Sprachen, die im Training stark vertreten sind. Siehe Mehrsprachiger Leitfaden.
Kann ich die Ausgabe bearbeiten?
Ja. Die Ausgabe ist ein Standard-MP4. Schneide sie, beschneide sie, composite sie, was auch immer dein Editor unterstützt.
Gibt es eine API?
Ja. Siehe API-Leitfaden.
Jetzt loslegen
- Bei Arteza anmelden und sichere dir deine 10 Gratiscredits
- Abonniere: der Creator-Plan für 25 Dollar gibt dir 300 Credits, also ungefähr 6 dreißigsekündige OmniHuman-Videos
- Foto und Audiodatei vorbereiten
- OmniHuman v1.5 öffnen
- Hochladen, konfigurieren, generieren
Günstige Tarife ab 5 Dollar/Monat. Kein Mindestvolumen. Einfach 7,20 Dollar pro lebensechtem 30-Sekunden-Sprechvideo, wann immer du eines brauchst.
Bereit, OmniHuman v1.5 auszuprobieren? Kostenlos loslegen →
OmniHuman v1.5 ausprobieren - Jetzt!
Lade dein Referenzbild auf der Erstellungsseite hoch.
5 kostenlose Generierungen · Keine Kreditkarte erforderlich