仕組み
顔を提供する
吹き替え用のビデオ、またはアニメーション化する1枚の肖像写真をアップロードしてください。正面を向いた、よく照らされた、口がはっきり見える顔が最も説得力のある同期を実現します。
オーディオを追加する
録音をアップロードするか、オーディオスタジオでテキスト音声合成またはクローンボイスを使用して音声を生成してください。モデルは各音声音を対応する口の形にマッピングします。
同期されたビデオを生成する
モデルは口の領域をフレームごとに再生成するか、写真から顔全体をアニメーション化するため、唇、顎、表情が音に合わせて動きます。
今すぐ使えるモデル
以下の各モデルは、スタジオで使用されているのと同じ価格エンジンから現在のクレジットコストを取得して、Artezaでライブ配信されています。
よくある質問
写真をリップシンクできますか、それともビデオが必要ですか?
両方のワークフローがサポートされています。Sync-3 Lipsyncは既存のビデオを最大4Kで新しいオーディオで吹き替えます。OmniHuman v1.5、Kling Avatar v2、Infini Talkは1枚の写真とオーディオファイルを完全なしゃべる動画にアニメーション化します。
AI リップシンクはあらゆる言語で機能しますか?
一般的にはい。モデルは単語を理解するのではなく音を口の形にマッピングするため、ほとんどの話し言葉に口を同期できます。これがリップシンクがビデオ翻訳とローカライズされたコンテンツの基盤である理由です。
最良の結果を得るにはどのような入力が必要ですか?
クリーンな音声オーディオ(ヘビーな音楽なし)と、合理的に大きく、正面を向いた、妨げられていない顔です。急速な頭の回転、口を覆う手、極端な角度はアーティファクトが現れる場所です。
他の人の顔を使用できますか?
同意がある場合のみです。リップシンクは正当な吹き替え、翻訳、アバターコンテンツに広く使用されていますが、同意した人の容貌のみをアニメーション化する必要があります。