Come creare video AI talking head con OmniHuman v1.5
Un tutorial passo dopo passo per creare video AI talking head professionali usando OmniHuman v1.5 su Arteza. Scopri come scegliere le foto, preparare l'audio, scrivere i prompt e ottimizzare i risultati.

Il tuo primo video talking head con OmniHuman v1.5 richiede circa dieci minuti dall'inizio alla fine, e costa esattamente $0,30-$7,20. Questo tutorial ti mostra ogni passaggio, ogni decisione sugli input e tutti i trucchi per la qualità che abbiamo imparato generando migliaia di video talking head sulla piattaforma.
Sintesi
- Servono una foto portrait, un file audio e un breve prompt di scena
- Un video da 30 secondi costa 72 crediti (~$7.20), con piani a partire da $5 al mese
- Scegli 720p per clip da 60 secondi o 1080p per clip da 30 secondi
- Buona foto + audio pulito + prompt specifico = risultato professionale al primo tentativo
- Modalità turbo per iterare, modalità standard per i contenuti definitivi
Cosa ti serve prima di iniziare
Tre input, nessuna eccezione:
- Una foto portrait - testa e spalle, ben illuminata, minimo 512x512 pixel
- Un file audio - MP3, WAV o M4A, parlato pulito, fino a 60 secondi
- Un prompt di scena - una breve descrizione dello sfondo e dell'illuminazione
Più un account Arteza con abbastanza crediti per la tua clip: 2,4 crediti per secondo di audio, quindi 46 per un video da 30 secondi. I nuovi account ricevono 10 crediti gratuiti alla registrazione, sufficienti per una breve clip di prova, e il piano Starter da $5 copre un mese di clip a lunghezza intera.
Crea subito il tuo presentatore AI
Trasforma una foto e un audio in un video parlante realistico. $7.20 per un video da 30 secondi, con piani a partire da $5 al mese.
Prova OmniHuman gratis5 generazioni gratuite · Nessuna carta di credito richiesta
Passo 1: scegli o crea la foto giusta
La foto è la singola leva di qualità più importante dell'intero flusso di lavoro. Fornisci al modello una foto eccellente e restituirà un video eccellente. Fornigli uno scatto frettoloso col telefono e l'output lo rifletterà.
Cosa rende ottima una foto di riferimento
- Luce uniforme. Luce naturale diffusa o luce da studio morbida. Nessuna ombra dura sul viso.
- Viso nitido. Occhi aperti, nessun riflesso sugli occhiali, nessun capello che copre i tratti, nessuna mano vicino al viso.
- Inquadratura corretta. Testa e spalle visibili. Il viso occupa almeno il 30% del fotogramma.
- Espressione neutra. Un viso rilassato o leggermente sorridente offre al modello la massima flessibilità.
- Sfondo pulito. Un alto contrasto tra soggetto e sfondo aiuta il modello a isolare l'identità.
- Risoluzione nitida. 1024x1024 o superiore. Nessuna sfocatura da movimento.
Non hai una foto? Generane una
Se hai bisogno di una foto di riferimento che non possiedi già, per un portavoce virtuale, una persona o un personaggio, usa Seedream per generarne una. Inserisci come prompt "foto professionale di [descrizione], illuminazione da studio morbida, sfondo neutro, sguardo in camera" e scegli il risultato più pulito.
Formati
JPEG e PNG funzionano entrambi. Gli sfondi trasparenti sono accettati. La piattaforma accetta foto fino a diversi megabyte.
Passo 2: prepara un audio pulito
Il tuo audio determina il lip sync, l'espressione facciale e il pattern gestuale. Più l'audio è pulito, più il modello ha con cui lavorare.
Opzioni di registrazione
Registrati tu stesso. Una stanza silenziosa e un buon microfono USB produrranno un audio abbastanza pulito per OmniHuman. Parla a un ritmo naturale, con pause naturali. Non sovra-articolare.
Usa un servizio TTS. Qualsiasi strumento di sintesi vocale di qualità funziona: ElevenLabs, Play.ht, Google, Amazon Polly. Esporta a 44,1 kHz o 48 kHz mono o stereo.
Estrai da audio esistente. Un segmento di podcast, una clip di webinar o una registrazione di voiceover funzionano tutti, purché il parlato sia isolato.
Cosa fare e cosa evitare con l'audio
- Fai il trim del silenzio iniziale e finale
- Fai la normalizzazione dei livelli audio per evitare il clipping
- Non lasciare musica o suoni ambientali pesanti nel mix
- Non usare registrazioni in ambienti con molto riverbero
- Non superare il limite di durata: 60s per 720p, 30s per 1080p
Passo 3: scrivi un prompt di scena utile
Il prompt di scena descrive l'ambiente visivo attorno al tuo presentatore. Non descrive la persona: il modello ricava quella informazione dalla foto.
Struttura di un buon prompt
Un prompt efficace include quattro elementi:
- Sfondo: dov'è la persona?
- Illuminazione: come è illuminata la scena?
- Inquadratura: quanto è vicina la telecamera?
- Stile: eventuali note sul tono o sulla resa?
Esempi di prompt che funzionano
Ufficio aziendale moderno con grandi finestre, luce naturale morbida da sinistra, inquadratura a mezzo busto su testa e spalle, stile broadcast professionale.
Studio minimalista con sfondo sfumato morbido, illuminazione da studio uniforme, piano americano, look pulito e contemporaneo.
Home office accogliente con librerie sullo sfondo, luce del pomeriggio dorata, inquadratura a mezzo busto, tono naturale e accessibile.
Cosa evitare nei prompt
- Non descrivere la persona (colore dei capelli, età, abbigliamento): se ne occupa la foto
- Non contraddire la foto (nessun "sfondo bianco" se la foto ha uno sfondo nero, a meno che tu non voglia davvero che il modello lo sostituisca)
- Non usare frasi vaghe come "buona illuminazione": scegli una fonte di luce specifica
- Non sovraccaricare il prompt con più di cinque o sei dettagli
Passo 4: carica e configura
Apri arteza.ai e seleziona OmniHuman v1.5, oppure vai direttamente a pagina del modello.
Ordine di caricamento
- Foto di riferimento: trascina il portrait nello slot immagine
- File audio: deposita il file parlato nello slot audio
- Prompt di scena: incolla la descrizione della scena
Configura le impostazioni
- Risoluzione: 720p per bozze o clip più lunghe di 30s, 1080p per render finali professionali
- Modalità turbo: attiva per iterare, disattiva per la qualità finale
- Verifica il costo in crediti: l'interfaccia confermerà il costo esatto in crediti prima della generazione
Passo 5: genera e rivedi
Clicca su genera. La modalità standard richiede diversi minuti. La modalità turbo è più veloce. Riceverai una notifica quando il video è pronto.
Come rivedere l'output
Riproduci il video a schermo intero e controlla questi quattro elementi:
- Lip sync: le forme della bocca corrispondono ai fonemi?
- Identità: il viso assomiglia al riferimento per tutta la durata?
- Naturalezza dei gesti: il movimento sembra organico, non robotico?
- Coerenza dello sfondo: la scena corrisponde al tuo prompt?
Se qualcuno di questi aspetti non convince, la correzione è quasi sempre negli input, non in un nuovo tentativo. Sostituisci la foto, pulisci l'audio o affina il prompt.
Pronto a provare OmniHuman v1.5? Inizia a creare gratis →

Vuoi un presentatore come questo? Prova OmniHuman gratis →
Consigli avanzati dai flussi di lavoro di produzione reale
Usa il turbo per esplorare, lo standard per i finali
La modalità turbo costa quanto la modalità standard per lo stesso audio, ma riduce i tempi di attesa. Usala per testare rapidamente prompt o take audio diversi, poi renderizza la versione finale in modalità standard.
Abbina l'emozione dell'audio all'espressione della foto di riferimento
Se la tua foto mostra un viso neutro ma l'audio è molto animato, il modello genererà molti movimenti. Se l'audio è calmo e la foto sorride, aspettati variazioni sottili. Abbinali per ottenere risultati prevedibili.
Dividi i contenuti lunghi in segmenti
Hai bisogno di un video da 90 secondi? Dividi l'audio in due segmenti (ad es. 45s ciascuno), genera due clip in 720p e uniscili in qualsiasi editor video. L'identità rimane coerente perché stai usando la stessa foto di riferimento.
Prepara più foto della stessa persona
Avere tre o quattro foto di riferimento della stessa persona, con abiti diversi, illuminazione diversa ed espressioni diverse, ti permette di abbinare la foto al tono del contenuto. Un aneddoto caldo riceve una foto più calda; un aggiornamento aziendale riceve la foto professionale.
Tieni una libreria di prompt
Salva i prompt di scena che hanno funzionato. "Sfumatura da studio minimalista" o "luce da finestra in ufficio moderno" possono essere riutilizzati su più progetti per una coerenza visiva.
Errori comuni e come correggerli
Il lip sync sembra leggermente sfasato
- Controlla la qualità audio. Rumore, artefatti di compressione o un basso bitrate compromettono l'estrazione dei fonemi
- Controlla la durata. Le clip esattamente al limite possono essere tagliate sull'ultimo fotogramma: punta a un secondo in meno
- Prova una registrazione più pulita o riesporta a un bitrate più alto
Il viso sembra "plasticoso" o troppo levigato
- Usa una foto a risoluzione più alta. Un input sotto i 512px produce un output sfocato
- Modifica l'illuminazione nel prompt su "naturale" invece di "da studio" per più texture
I gesti sembrano troppo sottili
- Usa un audio più espressivo. Un parlato monotono produce una variazione gestuale minima
- Scegli una foto con una postura leggermente aperta anziché un'inquadratura frontale rigida
Lo sfondo non corrisponde al prompt
- Sii più specifico. "Ufficio" è vago; "ufficio moderno con una libreria dietro il soggetto e una grande finestra a sinistra" è praticabile
- Considera il contesto della foto. Il modello usa lo sfondo della foto come riferimento
I costi per diversi tipi di progetto
Ogni video OmniHuman v1.5 costa 3-72 crediti ($0,30-$7,20). Ecco come si traduce in pratica:
| Progetto | Video necessari | Costo totale |
|---|---|---|
| Singolo post LinkedIn | 1 | $7.20 |
| Serie di benvenuto da cinque video | 5 | $36 |
| Corso da dieci lezioni | 10 | $72 |
| Aggiornamenti settimanali per un anno | 52 | $499.20 |
Confrontalo con i $24-$48 al mese di HeyGen (anche nei mesi in cui non crei nulla) o i $30-$90 al mese di Synthesia. A volumi bassi e medi, OmniHuman fa risparmiare centinaia di dollari all'anno. Consulta dettaglio completo dei prezzi per ogni livello.
Paga per video, non al mese
Un talking head da 30 secondi costa $7.20, con piani a partire da $5 al mese senza contratto annuale. I crediti mensili si rinnovano a ogni ciclo di fatturazione. I crediti extra acquistati non scadono mai.
Genera il tuo primo videoChecklist per il tuo primo video
- Foto portrait, 1024x1024 o superiore, ben illuminata, espressione neutra
- File audio pulito, sotto i 60 secondi, senza musica né riverbero
- Prompt di scena con sfondo, illuminazione, inquadratura e stile
- Account Arteza con almeno 72 crediti
- Scelta della risoluzione (720p o 1080p)
- Decisione sulla modalità turbo
- Apri OmniHuman v1.5 e genera
Una volta pubblicato il tuo primo talking head, esplora guida tecnica alla sincronizzazione labiale, guida al flusso di lavoro multilingue e tutorial specifici per casi d'uso come conduttori di telegiornale e formazione aziendale.
Pronto a provare OmniHuman v1.5? Inizia a creare gratis →
Prova OmniHuman v1.5 - Ora stesso
Carica la tua immagine di riferimento nella pagina di creazione.
5 generazioni gratuite · Nessuna carta di credito richiesta