工作原理
1
录制清晰样本
安静的房间、单个说话者、没有音乐和自然的表达方式能让模型准确捕捉语音特征。样本质量比长度更重要,即使是简短的清晰片段也能生成可用的克隆。
2
创建克隆
将样本上传到音频工作室,模型会提取使该语音独特的特征。运行前会显示所需的额度成本。
3
输入任何内容,听它朗读
克隆语音就像个人文字转语音工具:编写脚本并用该语音生成旁白,修正错误的部分而无需重新录制,或将音频输入到唇形同步的虚拟形象中。
您可以立即使用的模型
以下每个模型均在Arteza上可用,并显示其当前积分成本,该成本来自工作室在生成时的定价引擎。
常见问题解答
克隆语音需要多少音频?
现代模型可以从不到一分钟的清晰单说话者音频生成可用的克隆。更长和更多样化的样本能提高准确度,特别是对于富有表现力或带口音的语音。
语音克隆合法吗?
克隆自己的语音,或在所有者明确许可的情况下克隆他人语音是公认的用法。未经同意克隆他人语音可能违反许多司法管辖区的肖像权、欺诈和冒充法律。
如果我没有语音样本怎么办?
同一页面上有两个替代方案:MiniMax Voice Design可以从文本描述创建全新的自定义语音,ElevenLabs TTS提供大量现成的自然语音库。只有当你需要特定的真实语音时才需要克隆。
我可以用克隆语音做什么?
为视频配音而无需录制每一遍,在内容中保持一致的语音,在保留说话者特征的同时本地化脚本,以及驱动唇形同步的虚拟形象视频。ElevenLabs Voice Convert还可以将现有录音转换为另一种语音。