Come Creare Video di Avatar Parlanti con OmniHuman v1.5
Un tutorial passo dopo passo per creare video professionali di avatar parlanti con intelligenza artificiale utilizzando OmniHuman v1.5 su Arteza. Impara la selezione delle foto, la preparazione dell'audio, la scrittura dei prompt e le tecniche di ottimizzazione per i migliori risultati.

Il tuo primo video di talking head OmniHuman v1.5 richiede circa dieci minuti da inizio a fine - e costa esattamente $9,60. Questo tutorial mostra ogni passaggio, ogni scelta di input e ogni trucco di qualità che abbiamo imparato generando migliaia di video talking head sulla piattaforma.
TL;DR
- Ti serve una foto ritratto, un file audio e un breve prompt di scena
- Ogni generazione costa 960 crediti (~$9,60) - piani di abbonamento convenienti
- Scegli 720p per clip da 60 secondi o 1080p per clip da 30 secondi
- Buona foto + audio pulito + prompt specifico = risultato professionale al primo tentativo
- Modalità turbo per l'iterazione, modalità standard per contenuti hero
Quello che ti serve prima di iniziare
Tre input, senza eccezioni:
- Una foto ritratto - testa e spalle, ben illuminata, minimo 512x512 pixel
- Un file audio - MP3, WAV o M4A, voce pulita, fino a 60 secondi
- Un prompt di scena - una breve descrizione dello sfondo e dell'illuminazione
Più un account Arteza con almeno 960 crediti. I nuovi account ricevono 50 crediti gratuiti alla registrazione, ma un talking head costa 960, quindi avrai bisogno di almeno un pacchetto Starter di $10 per eseguire il tuo primo video.
Crea il tuo presentatore AI ora
Trasforma una foto + audio in un video parlante realistico. $9,60 per video, piani di abbonamento convenienti.
Prova OmniHuman gratis5 generazioni gratuite · Nessuna carta di credito richiesta
Passaggio 1: Scegli o crea la foto giusta
La foto è la leva di qualità singola più importante nell'intero flusso di lavoro. Fornisci al modello una foto eccellente e restituirà un video eccellente. Forniscigli uno scatto telefonico affrettato e l'output lo rifletterà.
Cosa rende grande una foto di riferimento
- Illuminazione uniforme. Luce naturale diffusa o luce da studio morbida. Nessuna ombra dura sul viso.
- Viso nitido. Occhi aperti, nessun riflesso di occhiali, nessun capello che copra i lineamenti, nessuna mano vicino al viso.
- Inquadratura giusta. Testa e spalle visibili. Il viso occupa almeno il 30% dell'inquadratura.
- Espressione neutra. Un viso rilassato o lievemente piacevole dà al modello la massima flessibilità.
- Sfondo pulito. Alto contrasto tra soggetto e sfondo aiuta il modello a isolare l'identità.
- Risoluzione nitida. 1024x1024 o più grande. Nessuna sfocatura di movimento.
Non hai una foto? Generane una
Se hai bisogno di una foto di riferimento che non hai già - per un portavoce virtuale, una persona o un personaggio - usa Seedream per generarne una. Richiedi "professional headshot of [description], soft studio lighting, neutral background, looking at camera" e scegli il risultato più pulito.
Formati
JPEG e PNG funzionano entrambi. Sfondi trasparenti sono accettabili. La piattaforma accetta foto fino a diversi megabyte.
Passaggio 2: Prepara audio pulito
Il tuo audio determina la sincronizzazione labiale, l'espressione facciale e il pattern di gesto. Più pulito è l'audio, più il modello ha con cui lavorare.
Opzioni di registrazione
Registra te stesso. Una stanza tranquilla e un decente microfono USB produrranno audio sufficientemente pulito per OmniHuman. Parla a un ritmo naturale, con pause naturali. Non iper-articolare.
Usa un servizio TTS. Qualsiasi strumento text-to-speech di qualità funziona - ElevenLabs, Play.ht, Google, Amazon Polly. Esporta a 44,1kHz o 48kHz mono o stereo.
Estrai da audio esistente. Un segmento di podcast, una clip di webinar o una registrazione di voiceover funzionano tutti finché il parlato è isolato.
Regole audio
- Sì taglia silenzio iniziale e finale
- Sì normalizza i livelli audio per prevenire il clipping
- No non lasciare musica o suoni ambientali pesanti nel mix
- No non usare registrazioni in stanze con molta riverbero
- No non superare il limite di durata: 60s per 720p, 30s per 1080p
Passaggio 3: Scrivi un prompt di scena che aiuti
Il prompt di scena descrive l'ambiente visivo intorno al tuo presentatore. Non descrive la persona - il modello lo ottiene dalla foto.
Buona struttura del prompt
Un prompt forte include quattro elementi:
- Sfondo - dove si trova la persona?
- Illuminazione - come è illuminata la scena?
- Inquadratura - quanto è vicina la telecamera?
- Stile - note sul tono o sulla finitura?
Prompt di esempio che funzionano
Ufficio aziendale moderno con ampie finestre, morbida illuminazione naturale da sinistra, inquadratura in primo piano testa e spalle, stile broadcast professionale.
Impostazione studio minimalista con sfondo sfumato morbido, illuminazione da studio uniforme, piano medio, aspetto pulito e contemporaneo.
Accogliente home office con librerie sullo sfondo, luce solare dorata del pomeriggio, primo piano medio, tono naturale e accessibile.
Cosa evitare nei prompt
- Non descrivere la persona (colore dei capelli, età, vestito) - la foto lo gestisce
- Non contraddire la foto (no "sfondo bianco" se la foto ha uno sfondo nero, a meno che non voglia davvero che il modello lo sostituisca)
- Non usare frasi vaghe come "buona illuminazione" - scegli una fonte di luce specifica
- Non sovraccaricare il prompt con più di cinque o sei dettagli
Passaggio 4: Carica e configura
Apri arteza.ai e seleziona OmniHuman v1.5, oppure vai direttamente a pagina del modello.
Ordine di caricamento
- Foto di riferimento - trascina il ritratto nello slot immagine
- File audio - rilascia il file voce nello slot audio
- Prompt di scena - incolla la descrizione della scena
Configura le impostazioni
- Risoluzione: 720p per bozze o clip più lunghe di 30s, 1080p per rendering finali professionali
- Modalità turbo: attiva per l'iterazione, spenta per qualità finale
- Revisione costo crediti: l'interfaccia utente confermerà 960 crediti prima di generare
Passaggio 5: Genera e revisiona
Clicca genera. La modalità standard impiega diversi minuti. La modalità turbo è più veloce. Riceverai una notifica quando il video è pronto.
Revisione dell'output
Riproduci il video a dimensione intera e controlla questi quattro aspetti:
- Sincronizzazione labiale - le forme della bocca corrispondono ai fonemi?
- Identità - il viso assomiglia al riferimento durante il tutto?
- Naturalismo del gesto - il movimento sembra organico, non robotico?
- Coerenza dello sfondo - la scena corrisponde al tuo prompt?
Se uno di questi sembra errato, la correzione è quasi sempre negli input, non in un nuovo tentativo. Cambia foto, pulisci audio, o affina il prompt.
Pronto a provare OmniHuman v1.5? Inizia a creare gratuitamente →

Vuoi un presentatore come questo? Prova OmniHuman gratuitamente →
Suggerimenti avanzati da veri flussi di lavoro di produzione
Usa Turbo per l'esplorazione, Standard per i finali
La modalità turbo costa ancora 960 crediti per generazione, ma taglia l'attesa. Usala per testare rapidamente diversi prompt o audio take, poi renderizza la versione finale in modalità standard.
Abbina l'emozione audio all'espressione di riferimento
Se la tua foto mostra un viso neutro ma il tuo audio è altamente animato, il modello genererà molti movimenti. Se l'audio è calmo e la foto sta sorridendo, aspettati variazione sottile. Abbinali per risultati prevedibili.
Dividi i contenuti lunghi in segmenti
Hai bisogno di un video da 90 secondi? Dividi l'audio in due segmenti (ad es. 45s ciascuno), genera due clip 720p, e uniscile in qualsiasi editor video. L'identità rimane coerente perché stai usando la stessa foto di riferimento.
Prepara più foto per la stessa persona
Avere tre o quattro foto di riferimento della stessa persona - diversi outfit, diverse illuminazioni, diverse espressioni - ti permette di abbinare la foto al tono del contenuto. Un aneddoto caloroso riceve una foto più calorosa; un aggiornamento aziendale riceve il headshot.
Mantieni una libreria di prompt
Salva i prompt di scena che hanno funzionato. "Gradiente studio minimalista" o "luce finestra ufficio moderno" possono essere riutilizzati tra progetti per coerenza visiva.
Errori comuni e come correggerli
La sincronizzazione labiale sembra leggermente errata
- Controlla la qualità audio. Rumore, artefatti di compressione o bitrate basso danneggiano l'estrazione dei fonemi
- Controlla la durata. I clip al limite esatto possono essere ritagliati nell'ultimo fotogramma - mira a un secondo sotto
- Prova una registrazione più pulita o re-esporta a bitrate più alto
Il viso sembra "plasticoso" o troppo liscio
- Usa una foto a risoluzione più alta. Input sub-512px produce output soft
- Regola l'illuminazione del prompt su "naturale" invece di "studio" per più texture
I gesti sembrano troppo sottili
- Usa audio più espressivo. Il parlato monotono produce variazione di gesto minima
- Seleziona una foto con postura leggermente aperta piuttosto che framing rigido frontale
Lo sfondo non corrisponde al prompt
- Sii più specifico. "Ufficio" è vago; "ufficio moderno con una libreria dietro il soggetto e una grande finestra a sinistra" è attuabile
- Abbina il contesto della foto. Il modello pesa lo sfondo della foto come riferimento
Matematica dei costi per diversi progetti
Ogni video OmniHuman v1.5 costa 960 crediti (~$9,60). Ecco come appare nella pratica:
| Progetto | Video necessari | Costo totale |
|---|---|---|
| Singolo post LinkedIn | 1 | $9,60 |
| Serie di benvenuto a cinque video | 5 | $48 |
| Corso da dieci lezioni | 10 | $96 |
| Aggiornamenti settimanali per un anno | 52 | $499,20 |
Confrontalo con HeyGen's $24-$48 al mese (anche nei mesi in cui non crei nulla) o Synthesia's $30-$90 al mese. A bassi e moderati volumi, OmniHuman risparmia centinaia all'anno. Vedi dettaglio completo dei prezzi per ogni tier.
Paga per video, non per mese
Ogni talking head è $9,60 - piani di abbonamento convenienti da annullare, nessun minimo mensile. I crediti mensili si rinnovano ad ogni ciclo di fatturazione. I crediti top-up non scadono mai.
Genera il tuo primo videoChecklist del tuo primo video
- Foto ritratto, 1024x1024 o più grande, ben illuminata, espressione neutra
- File audio pulito, meno di 60 secondi, senza musica o riverbero
- Prompt di scena con sfondo, illuminazione, inquadratura, stile
- Account Arteza con almeno 960 crediti
- Scelta della risoluzione (720p o 1080p)
- Decisione sulla modalità turbo
- Apri OmniHuman v1.5 e genera
Una volta che hai lanciato il tuo primo talking head, esplora guida tecnica del lip sync, guida al flusso di lavoro multilingue, e tutorial specifici per casi d'uso come conduttori di telegiornale e formazione aziendale.
Pronto a provare OmniHuman v1.5? Inizia a creare gratuitamente →
Try OmniHuman v1.5 - Right Now
Upload your reference image on the create page.
5 free generations · No credit card needed