このアプリで作成
Wan 2.2 S2V は、1枚の静止写真と音声クリップを組み合わせて、被写体が動き、自然な音声同期で話す短いMP4ビデオを生成します。写真をアップロードし、最大7.5秒の音声を添付すると、モデルが音声のリズムとテンポに合わせた唇の動きと顔の動きを生成します。480p、580p、または720pで出力され、ライブビデオ撮影なしでリアルな話す顔を必要とするデジタルプレゼンター、ブランドスポークスパーソン、およびその他の誰もが使用できる実用的なツールです。
このアプリの使い方
- 1
作成したいものを説明するか、ソースファイルをアップロードしてください。
- 2
オプションを選択して、「生成」を押してください。
- 3
数秒でギャラリーに結果が表示されます。
- 4
ダウンロード、シェア、または新しいアイデアで再度生成できます。
作成できるもの
スライドデック用デジタルプレゼンター
プロフェッショナルなヘッドショットと記録されたナレーションをWan 2.2 S2Vに入力して、プレゼンテーションやランディングページに埋め込める話すプレゼンターのクリップを生成します。音声駆動の動きにより、アバターは硬直したり、ループしたりするのではなく、自然で気配りのある状態に見えます。
ローカライズされたスポークスパーソンクリップ
同じソーススクリプトから翻訳されたナレーションを記録し、1つのブランドスポークスパーソンの写真に添付して、各言語用のローカライズされたアバタービデオを生成します。モデルは新しい音声のテンポに従い、新しい写真撮影は必要ありません。
アニメーション化された追悼写真またはトリビュート写真
大切な肖像写真に音声を付けることで、記録されたメッセージとペアにして、写真を現在のものにします。Wan 2.2 S2Vは微妙で自然な顔の動きを生成し、写真が人工的にアニメーション化されるのではなく、実際の存在感を持つように感じさせます。
ソーシャルメディア向けトーキングヘッドコンテンツ
カメラ機器なしで720pで短くて洗練されたトーキングヘッドクリップをソーシャルフィードに向けて生成します。クリーンな肖像画とスクリプト化された音声クリップを組み合わせて、スケールで一貫したブランド向けコンテンツを作成します。
e-ラーニング向けキャラクターナレーター
イラストまたは写真のキャラクターをナレーション音声とペアにして、コースモジュール用のアニメーション講師を構築します。音声長の出力により、ビデオは完全にレッスンセグメントと同じ長さで実行されます。パディングは不要です。
試すプロンプトのアイデア
クリエイターがこのアプリを使う理由
- 写真と音声の入力
- 音声駆動モーション
- 480p / 580p / 720p
- 音声長出力
より良い結果のためのヒント
音声を制限内に保つ
音声制限は7.5秒です。アップロード前に、クリップを正確にトリミングしてください。途中で音声が途切れると、ビデオの終わりに唐突な動きが生じる可能性があるため、制限内で完全な考えで終わるようにスクリプトを計画してください。
クリアで正面向きの写真を使用
Wan 2.2 S2Vは、ソース画像の顔のランドマークから音声駆動の動きを生成します。目に見える唇と中立的な表情を持つ正面向きの肖像画がモデルに最も明確な参照を提供し、通常最も正確なリップシンクを生成します。
解像度をユースケースに合わせる
品質が重要な最終成果物には720pを選択し、迅速な反復または小形式の埋め込みには480pを選択します。最終化する前に解像度を確定することで、異なる品質レベルで同じクリップを再生成する必要がなくなります。
説明的なプロンプトを作成
モデルは、写真と音声と一緒にテキストプロンプトを受け入れます。これを使用して、設定、照明スタイル、および希望する気分を説明してください。「暖かいスタジオ照明、着実なアイコンタクト、専門的な態度」のようなプロンプトが、動きスタイルと視覚的な一貫性をガイドするのに役立ちます。
このアプリを選ぶべき場面
Wan 2.2 S2Vは、汎用マウスループではなく、実際の音声のテンポとリズムに応答する音声駆動の顔の動きが必要な場合に選択します。予算アバターオプションとして位置付けられているSadTalkerと比較して、Wan 2.2 S2Vは720pまでの高い解像度階層を提供し、ガイドするテキストプロンプトを受け入れます。あらゆるキャラクタータイプの多機能なリップシンクに焦点を当てているKling Avatar v2と比較して、Wan 2.2 S2Vは写真とプラス音声パイプラインの周りに目的が組み込まれており、音声長の出力を備えています。これは、ソース材料が既に肖像画と記録されたナレーションの場合、選択肢として適切です。
よくある質問
音声入力はどのファイル形式である必要がありますか?
アプリは、写真とペアになった音声ファイルを受け入れます。最良の結果を得るために、バックグラウンドノイズが最小限のクリアで明確な記録を使用してください。モデルはすべての顔の動きを音声信号から導き出すため、音声品質は出力の自然さに直接影響します。
実際の写真の代わりにイラストまたはAI生成の肖像画を使用できますか?
はい。Wan 2.2 S2Vは、認識可能な顔ランドマークを持つ明確に見える顔を含む任意の静止画像から機能します。イラストキャラクター、デジタル絵画、およびAI生成の肖像画はすべてアニメーション化できます。ただし、顔が正面向きで障害がない場合、結果は最も信頼できます。
出力ビデオには元の音声トラックが含まれていますか?
出力はMP4ビデオです。アップロードする音声が動きを駆動し、レンダリングされたファイルにはその音声が含まれるため、再生は既に同期されており、編集ソフトウェアで個別のマージステップは必要ありません。
音声が7.5秒より短い場合はどうなりますか?
出力時間は音声の長さと完全に一致します。これが音声長の出力機能の意味です。クリップが3秒の場合、3秒のビデオが得られます。音声が終わった後、パディングやループは追加されません。
テキストプロンプトは最終ビデオにどのように影響しますか?
プロンプトは、写真コンテンツをオーバーライドするのではなく、視覚スタイル、気分、環境をガイドします。照明、設定、被写体の態度を説明することで、モデルが意図と一致した動きと雰囲気を生成するのに役立ちます。特にソース写真背景が曖昧または単純な場合に役立ちます。
720pが最大解像度ですか?
720pは、現在Wan 2.2 S2Vで利用可能な最高解像度階層です。プロジェクトが4Kリップシンク出力を必要とする場合、その特定の要件には、4Kでビデオダビングを処理するSync-3 Lipsyncがより適切である可能性があります。
このアプリはどのAIモデルで動作していますか?
このアプリはWan 2.2 S2Vで動作し、Artezaを通じて利用でき、別のアカウントやセットアップは不要です。
生成した結果を商用利用できますか?
はい。生成したコンテンツはご自身でご利用いただけます。当社のコンテンツライセンスに従ってください。
生成にはどのくらい時間がかかりますか?
ほとんどの生成は1分以内に完了し、ギャラリーでリアルタイムで進捗を確認できます。