工作原理
1
提供面孔
上传要配音的视频,或上传单张肖像照片进行动画制作。正面、光线充足、嘴部清晰可见的面孔同步效果最佳。
2
添加音频
上传录音,或先在音频工作室中使用文本转语音或克隆语音生成语音。模型将每个语音音素映射到相应的嘴形。
3
生成同步视频
模型逐帧重新生成嘴部区域,或从照片制作整个面孔动画,使嘴唇、下颌和表情与声音同步移动。
您可以立即使用的模型
以下每个模型均在Arteza上可用,并显示其当前积分成本,该成本来自工作室在生成时的定价引擎。
常见问题解答
我可以对照片进行口型同步,还是必须使用视频?
两种工作流程都支持。Sync-3 Lipsync 可以用新音频为现有视频配音,分辨率最高达 4K。OmniHuman v1.5、Kling Avatar v2 和 Infini Talk 可以将单张照片加音频文件制作成完整的说话视频。
AI 口型同步适用于任何语言吗?
通常可以。该模型将声音映射到嘴形,而不是理解词语,因此可以将嘴部同步到大多数口语语言,这也是口型同步成为视频翻译和本地化内容基础的原因。
什么样的输入能获得最佳效果?
清晰的语音音频,没有过多背景音乐,以及相对较大、正面且无遮挡的面孔。快速转头、手遮嘴和极端角度是容易出现伪影的地方。
我可以使用他人的面孔吗?
只有在获得同意的情况下才可以。口型同步广泛用于合法的配音、翻译和虚拟形象内容,但您应该只制作已同意的人的肖像动画。