OmniHuman v1.5: crea avatar AI realistici da una singola foto
La guida completa a OmniHuman v1.5 su Arteza. Scopri come creare video con avatar AI realistici da una singola foto e un file audio, incluse funzionalità, requisiti di input, prezzi, specifiche di output e casi d'uso reali.

Una foto. Un file audio. Un video parlante realistico per $7,20, con piani che partono da $5 al mese, senza vincoli di carta di credito e senza contratti annuali. Questa è la promessa di OmniHuman v1.5, e questa guida ti mostra esattamente come mantenerla.
TL;DR
- Trasforma qualsiasi foto di un ritratto e un file audio in un video parlante realistico
- 3-72 crediti ($0,30-$7,20) per generazione - paghi solo quando crei
- 720p fino a 60 secondi, oppure 1080p fino a 30 secondi
- Sincronizzazione labiale fonema per fonema, gesti naturali, espressioni guidate dall'audio
- Da $5/mese. Disdici quando vuoi, a differenza di HeyGen ($24-$48/mese) o Synthesia ($30-$90/mese)
Cosa fa davvero OmniHuman v1.5
OmniHuman v1.5 è il modello avatar di punta di ByteDance, disponibile in esclusiva su Arteza. Carichi una singola foto di un ritratto e un file audio con il parlato, e il modello genera un video completo di testa parlante: sincronizzazione labiale, battiti delle palpebre, inclinazioni della testa, movimenti delle spalle e micro-espressioni, tutto sintetizzato da zero.
Non si tratta del vecchio trucco di "incollare una bocca animata su un viso statico". Ogni fotogramma viene generato da zero da un diffusion transformer che comprende sia l'identità che l'audio. La persona nella tua foto si muove come farebbe un essere umano reale mentre pronuncia quello specifico audio.
Se hai già usato Seedance 2.0 per video cinematografici o Seedream per la generazione di immagini, OmniHuman v1.5 completa il set: testo in immagine, immagine in video, e ora foto più audio in avatar.
Crea il tuo presentatore AI adesso
Trasforma una foto + audio in un video parlante realistico. $7,20 per un video di 30 secondi, con piani da $5 al mese.
Prova OmniHuman gratis5 generazioni gratuite · Nessuna carta di credito richiesta
Le cinque funzionalità che contano davvero
1. Sincronizzazione labiale a livello di fonema
Il modello estrae i fonemi dall'audio e li associa alle forme esatte della bocca fotogramma per fotogramma. Le occlusive come "p" e "b" mostrano la chiusura delle labbra. Le fricative come "f" e "v" mostrano i denti sul labbro. Le vocali producono la corretta apertura della mascella. Gli spettatori che guardano con l'audio attivo non coglieranno alcun difetto di sincronizzazione.
2. Espressioni facciali guidate dall'audio
Quando l'audio suona entusiasta, le sopracciglia si alzano. Quando c'è una pausa per dare enfasi, gli occhi si restringono leggermente. Questi segnali vengono dedotti dalla prosodia vocale, non imposti da modelli rigidi.
3. Generazione di gesti naturali
Movimenti delle spalle, rotazioni della testa e sottili cambiamenti posturali emergono dal segnale vocale stesso. Chi sta sottolineando un punto si sporge in avanti. Chi elenca degli elementi sposta il peso. Il movimento è correlato al significato, non a un timer.
4. Modalità turbo
Hai bisogno di velocità per iterare? La modalità turbo riduce i tempi di generazione senza modificare il costo in crediti. Usala per verificare prompt e input, poi passa alla modalità standard per il render finale.
5. Doppia risoluzione, doppia durata
| Risoluzione | Durata audio massima | Ideale per |
|---|---|---|
| 720p (1280x720) | 60 secondi | Clip social, formazione, bozze |
| 1080p (1920x1080) | 30 secondi | Lavori per clienti, demo di prodotto, marketing |
Come funziona la pipeline
Capire le fasi ti aiuta a fornire al modello input migliori.
Fase 1: estrazione dell'identità. Un encoder facciale trasforma la tua foto in un embedding ad alta dimensionalità che cattura la struttura ossea, il tono della pelle, la forma degli occhi e centinaia di altri marcatori. Questo embedding mantiene il viso coerente in ogni fotogramma.
Fase 2: analisi audio. La traccia parlata viene analizzata per fonemi, prosodia, contorno energetico e tono emotivo.
Fase 3: sintesi del movimento. Una rete di movimento trasforma le caratteristiche audio in parametri per-fotogramma per viso, testa e spalle.
Fase 4: rendering con diffusione. Un transformer genera i pixel finali, combinando identità, movimento e la descrizione della scena fornita nel prompt.
Fase 5: coerenza temporale. Un passaggio di raffinamento elimina sfarfallio, instabilità e deriva dell'identità tra i fotogrammi.
Cosa devi fornire
Foto di riferimento
- Risoluzione: minimo 512x512, idealmente 1024x1024 o superiore
- Composizione: testa e spalle, il viso deve occupare almeno il 30% dell'inquadratura
- Illuminazione: uniforme e diffusa è sempre meglio delle ombre dure
- Espressione: neutra o leggermente piacevole offre al modello il massimo margine di lavoro
- Formato: JPEG o PNG
File audio
- Formato: MP3, WAV o M4A
- Durata: fino a 60s a 720p, fino a 30s a 1080p
- Qualità: parlato pulito, senza musica di sottofondo né riverbero eccessivo
- Lingua: funziona con qualsiasi lingua parlata
Prompt testuale
Descrivi la scena: sfondo ("ufficio moderno con grandi finestre"), illuminazione ("luce principale soffusa da sinistra"), inquadratura ("piano americano, testa e spalle") e qualsiasi nota sullo stile.
Prezzi: il calcolo del pay-per-use
OmniHuman v1.5 costa 2,4 crediti per secondo di audio, ovvero 72 crediti, o circa $7,20, per un video di 30 secondi alla tariffa base. I crediti sono inclusi in un piano mensile a partire da $5. Ti abboni, li spendi quando generi e il saldo si rinnova a ogni ciclo di fatturazione.
| Piano mensile | Prezzo | Crediti | Costo effettivo per video da 30 secondi |
|---|---|---|---|
| Starter | $5/mese | 60 | ~$3,83 |
| Creator | $25/mese | 300 | ~$3,83 |
| Pro | $50/mese | 700 | ~$3,29 |
| Studio | $120/mese | 1.800 | ~$3,07 |
Perché questo è meglio degli abbonamenti
HeyGen parte da $24/mese con un limite mensile di minuti. Synthesia parte da $30/mese. D-ID parte da $5/mese per un'allowance minima e scala fino a $300/mese.
Con OmniHuman v1.5 non paghi nulla nei mesi in cui non crei nulla. Fai un video da 30 secondi per $7,20. Fanne dieci per $72. Non fare nulla e non pagare nulla. I nuovi account ricevono anche 10 crediti gratuiti alla registrazione per esplorare Seedream e Seedance 1.0 Lite prima di acquistare.
Consulta il riepilogo completo nel nostro Guida ai prezzi di OmniHuman v1.5.
Vuoi provare OmniHuman v1.5? Inizia a creare gratis →

Vuoi un presentatore come questo? Prova OmniHuman gratis →
Passo dopo passo: il tuo primo video in pochi minuti
- Prepara la foto. Scegli un ritratto ben illuminato, oppure generane uno con Seedream.
- Prepara l'audio. Registra la tua voce, o usa un TTS di qualità. Elimina i silenzi all'inizio e alla fine.
- Apri il modello. Vai su arteza.ai e seleziona OmniHuman v1.5, oppure vai direttamente a pagina del modello.
- Carica gli input. Foto, audio e un breve prompt sulla scena.
- Configura. Scegli 720p o 1080p, attiva la modalità turbo se vuoi velocità.
- Genera. Dopo qualche minuto il tuo video è pronto.
- Rivedi e scarica. Output in MP4, pronto per qualsiasi editor o piattaforma.
Per una guida più dettagliata, consulta tutorial sulla testa parlante.
Casi d'uso concreti che vale la pena conoscere
Formazione aziendale - Video con presentatori coerenti senza dover organizzare riprese. Aggiorna i contenuti semplicemente sostituendo l'audio. Guida completa.
E-learning - Gli istruttori dei corsi possono pubblicare lezioni su larga scala. Gli avatar mantengono l'attenzione meglio delle slide statiche con voiceover. Guida completa.
Outreach commerciale - Messaggi video personalizzati che si rivolgono ai potenziali clienti per nome. Guida completa.
Assistenza clienti - Video di risposta alle FAQ che risolvono i problemi più velocemente degli articoli di supporto. Guida completa.
YouTube e podcast - Co-conduttori AI, segmenti esplicativi e versioni video di show audio. Consulta le guide YouTube e podcast.
Educazione sanitaria - Materiali esplicativi per i pazienti in qualsiasi lingua, partendo da un unico volto autorevole. Guida completa.
Contenuti multilingua - Stessa foto, audio diverso, dieci versioni in lingue diverse con identità coerente. Guida completa.
Consigli per migliorare la qualità dell'output
Selezione della foto
- Illuminazione uniforme e soffusa, senza ombre dure
- Angolazione frontale o leggermente a tre quarti
- Mani lontane dal viso
- Sfondo pulito che contrasti con il soggetto
Preparazione dell'audio
- Registra in un ambiente silenzioso con riverbero minimo
- Parla a un ritmo naturale, includi pause reali
- Normalizza i livelli per evitare il clipping
- Rimuovi musica o rumore ambientale prima di caricare
Scrittura del prompt
- Sii specifico: "ufficio moderno con grandi finestre" è meglio di "sfondo carino"
- Indica l'illuminazione: "luce principale da studio soffusa" o "sole caldo del pomeriggio"
- Specifica l'inquadratura: "primo piano medio, testa e spalle"
- Non contraddire la foto (non descrivere un colore di capelli diverso)
Iterazione
- Modalità turbo per le prove
- Cambia una variabile alla volta
- Conserva un file con i prompt che hanno funzionato
OmniHuman v1.5 a confronto con le alternative
| Funzionalità | OmniHuman v1.5 | HeyGen | Synthesia | D-ID |
|---|---|---|---|---|
| Input con foto personalizzata | Sì | Limitato | No (avatar preimpostati) | Sì |
| Qualità della sincronizzazione labiale | Eccellente | Buona | Buona | Discreta |
| Generazione dei gesti | Guidata dall'audio | Basata su template | Basata su template | Limitata |
| Risoluzione massima | 1080p | 1080p | 1080p | 1024x1024 |
| Modello di prezzo | Pay-per-use | Abbonamento | Abbonamento | Misto |
| Costo per video | ~$7,20 per 30s | $24-48/mese | $30-90/mese | $5-300/mese |
| Crediti gratuiti alla registrazione | 10 crediti | Prova limitata | Prova gratuita | Prova limitata |
Confronti diretti:
Evita la trappola dell'abbonamento mensile
HeyGen, Synthesia e D-ID ti addebitano ogni mese, anche quando non crei nessun video. OmniHuman v1.5 addebita $7,20 solo quando crei.
Genera il tuo primo videoLimitazioni da conoscere
- Limiti di durata. 60s a 720p, 30s a 1080p. I contenuti più lunghi richiedono il montaggio di più segmenti.
- Una persona per video. Le scene con più persone richiedono compositing.
- Solo parte superiore del corpo. Nessuna animazione a figura intera.
- La qualità audio conta. Input scadente, sincronizzazione labiale scadente.
- Non è in tempo reale. Le generazioni richiedono minuti, non millisecondi.
- Nessuno streaming live. L'output è un MP4 pre-renderizzato.
Domande frequenti
Posso usare qualsiasi foto?
Puoi usare qualsiasi foto che soddisfi i requisiti di input, ma sei responsabile dei diritti e delle autorizzazioni. I termini di servizio di Arteza coprono i dettagli legali.
Funziona con audio in lingue diverse dall'inglese?
Sì. Funziona con qualsiasi lingua parlata, con la massima precisione per le lingue con una rappresentazione forte nel training. Consulta guida multilingue.
Posso modificare l'output?
Sì. L'output è un MP4 standard. Taglilo, ritaglialo, usalo in compositing: qualunque cosa supporti il tuo editor.
C'è un'API?
Sì. Consulta guida all'API.
Inizia a creare
- Iscriviti ad Arteza e prendi i tuoi 10 crediti gratuiti
- Abbonati: il piano Creator da $25 ti dà 300 crediti, circa 6 video OmniHuman da trenta secondi
- Prepara una foto e un file audio
- Apri OmniHuman v1.5
- Carica, configura, genera
Piani accessibili da $5/mese. Nessun minimo. Solo $7,20 per ogni video parlante realistico da 30 secondi, quando ne hai bisogno.
Vuoi provare OmniHuman v1.5? Inizia a creare gratis →
Prova OmniHuman v1.5 - Ora stesso
Carica la tua immagine di riferimento nella pagina di creazione.
5 generazioni gratuite · Nessuna carta di credito richiesta