このアプリで作成
OmniHuman v1.5は、1枚のポートレート写真とオーディオファイルから、完全にアニメーション化されたトーキングアバタービデオを生成します。リップシンク、自然な表情、音声に合わせたジェスチャーが同期され、720pまたは1080pのクリーンなMP4形式で出力されます。仮想プレゼンター、ブランドのスポークスパーソン、eラーニングナレーター、スタジオ機材を必要としないポーランド映像が必要な誰もが活用できます。
このアプリの使い方
- 1
作成したいものを説明するか、ソースファイルをアップロードしてください。
- 2
オプションを選択して、「生成」を押してください。
- 3
数秒でギャラリーに結果が表示されます。
- 4
ダウンロード、シェア、または新しいアイデアで再度生成できます。
作成できるもの
バーチャル講座講師
プロフェッショナルなヘッドショットと録音された講義スクリプトをアップロードすると、自然に話し、ジェスチャーし、反応するオンスクリーン講師が生成されます。OmniHuman v1.5は顔の表情を声のトーンに合わせて調整するため、720pの最大60秒のオーディオウィンドウ全体を通じてアバターが機械的ではなく魅力的に見えます。
多言語製品デモ
任意の言語でボイスオーバーを録音し、1枚のブランド代表写真と組み合わせれば、数分でローカライズされたスポークスパーソンビデオが生成されます。OmniHuman v1.5は音声リズムからジェスチャーを導出するため、マニュアルキーフレーミングなしで各言語の自然なケイデンスに合わせてボディランゲージが適応します。
企業内アナウンスメント
HR部門とコミュニケーション部門は、1枚のエグゼクティブヘッドショットを会社全体配布向けのプロフェッショナルなビデオメッセージに変換できます。1080p出力オプションは大画面での高品質を確保し、完璧なリップシンクはエグゼクティブが直接カメラに映ることができない場合でも信頼性を維持します。
ソーシャルメディアペルソナビデオ
舞台裏に留まることを好むコンテンツクリエイターは、1枚のポートレートから一貫したオンスクリーンペルソナを構築できます。各投稿のためにスクリプト化されたオーディオを入力すると、シリーズ内のすべてのビデオで同じ顔、表情、ジェスチャースタイルを維持するMP4アバターが受け取れます。
プロトタイプマーケティングスポット
ライブ撮影にコミットする前に、マーケティングチームはスクリプトと視覚的方向性をストック写真またはコンセプト写真から生成したリアルなプレゼンタービデオで検証できます。30秒1080p制限は典型的な広告とソーシャルビデオ形式に適しており、レビュー時間とコストが削減されます。
試すプロンプトのアイデア
クリエイターがこのアプリを使う理由
- 単一写真入力
- 完璧なリップシンク
- 自然な表情
- ジェスチャー生成
- ターボモード
- 720p/1080p出力
より良い結果のためのヒント
クリーンなポートレートを選択する
OmniHuman v1.5はすべてのアニメーションを1枚の写真から構築するため、画像品質が重要です。照明が良く、正面を向いた、背景がニュートラルなポートレートを使用してください。ヘビーなフィルター、極端なアングル、または部分的な顔クロップは避けてください。これらはモデルがリップムーブメントと表情を正確に生成する能力を制限します。
オーディオ長を解像度に合わせる
アプリは720pで最大60秒、1080pで最大30秒をサポートしています。録音する前に、スクリプトが正しい制限内に収まるように計画してください。後からオーディオをトリミングすると、多くの場合突然の終了が生じるため、最初にナレーションを記述してタイミングを決定し、その後オーディオ期間に合った解像度を選択してください。
表現力豊かなオーディオをより良いジェスチャーのために使用する
OmniHuman v1.5でのジェスチャー生成は、オーディオの音声リズムと感情によって駆動されます。フラットで単調な録音は最小限の動きを生成します。自然なペーシング、多様な強調、明確な感情的意図で録音して、より動的で生き生きとしたアバターと、適切なヘッドティルトとボディジェスチャーを取得してください。
高速反復のためにターボモードを使用する
ターボモードは生成を加速し、最終レンダリングにコミットする前に異なるオーディオテイクまたはポートレート選択肢をテストするのに理想的です。最初に720pでターボモードを使用してアバターをドラフト化し、結果がニーズを満たしていることを確認してから、配布用のポーランド1080pバージョンを生成してください。
このアプリを選ぶべき場面
OmniHuman v1.5は、リアリズムと表現力豊かな同期が最優先事項である場合に最適な選択肢です。SadTalkerと比較して、より自然な顔の動きと頭部の動きだけでなく完全なジェスチャーアニメーションを生成します。Sync-3 Lipsyncと比較して、既存のビデオフッテージを入力として必要とするのではなく、1枚の写真から完全なアニメーション化されたアバターを生成します。最小限のソース材料からの信頼できる仮想プレゼンターが目標である場合、OmniHuman v1.5はラインアップ内で最も完全なソリューションです。
よくある質問
写真の代わりにイラストやスタイライズされたポートレートを使用できますか?
OmniHuman v1.5はデジタルイラストやレンダリングされたキャラクターなどの非写真的ポートレートをアニメーション化できますが、結果はリアルな人間のポートレートで最も信頼できます。誇張された比例または非人間的な特徴を持つ高度にスタイライズされた画像は、一貫性のないリップシンクと表現精度を生成する可能性があります。
モデルは写真内の人の身元と外観を保持していますか?
はい。OmniHuman v1.5は、生成されたビデオ全体を通じて、顔、肌色、髪、および全体的な外観をポートレート入力と一貫させます。それは顔を置き換えるのではなくアニメーション化するため、アバターは元の写真の人物のように見えます。
どのオーディオ形式と品質レベルが最適に機能しますか?
アプリは標準的なオーディオファイルを受け入れていますが、バックグラウンドノイズや過度な圧縮なしで一貫した音量レベルで記録された明確な音声は、最も正確なリップシンクを生成します。リバーブまたは重複する音声による過度に処理されたオーディオは避けてください。これらはジェスチャー生成を駆動するリズム検出を混乱させる可能性があります。
ジェスチャーまたは表情の強度を制御する方法はありますか?
OmniHuman v1.5でのジェスチャーと表情の強度は、マニュアルコントロールではなく、オーディオの感情とリズムから自動的に導出されます。記録されたオーディオの配信、ペーシング、および表現力を調整することが、最終的なビデオでアバターがどの程度アニメーション化されているかを影響させる主な方法です。
アバターは任意の言語で話すことができますか?
OmniHuman v1.5は特定の言語ルールではなく、オーディオ波形とその感情的な内容からリップシンクとジェスチャーを生成するため、複数の言語で機能します。訓練データでは一般的ではない音韻パターンを持つ言語については、リップ精度がわずかに異なる場合がありますが、全体的な結果は広く多言語です。
リップシンクが場所によって少しずれているように見える場合、どうすればよいですか?
より明確な発音とやや遅いペースでオーディオを再録音すると、多くの場合、軽微な同期の問題が解決されます。また、ターボモードを使用して、完全な1080pレンダリングにクレジットを費やす前に、代替オーディオテイクをすばやくテストできます。元のオーディオ内のバックグラウンドノイズが同期ドリフトの最も一般的な原因です。
このアプリはどのAIモデルで動作していますか?
このアプリはOmniHuman v1.5で動作し、Artezaを通じて利用でき、別のアカウントやセットアップは不要です。
生成した結果を商用利用できますか?
はい。生成したコンテンツはご自身でご利用いただけます。当社のコンテンツライセンスに従ってください。
生成にはどのくらい時間がかかりますか?
ほとんどの生成は1分以内に完了し、ギャラリーでリアルタイムで進捗を確認できます。