仕組み
耳に心地よい文章を書く
句読点がペースを決めます。カンマと句点は人間が呼吸するところに一時停止を作ります。長い文より短い文の方が読みやすく、数字と頭字語を綴ることで誤読を防げます。
音声とエンジンを選択する
音声ライブラリを参照して、トーンをコンテンツに合わせます。ドキュメンタリー風の音声はエネルギッシュな広告には合いません。ElevenLabs は自然さで優れており、MiniMax Speech 2.8 Turbo は大量生成に向けた高速で手頃な選択肢です。
生成して再利用する
オーディオはブラウザで生成され、クレジットコストが事前に表示されます。ナレーション、オーディオブック下書き、または同じワークスペース内のリップシンク済みアバターに入力として使用できます。
今すぐ使えるモデル
以下の各モデルは、スタジオで使用されているのと同じ価格エンジンから現在のクレジットコストを取得して、Artezaでライブ配信されています。
よくある質問
現在の AI テキスト音声変換はどの程度リアルですか?
最新のニューラル TTS は人間が実際に話す方法を学習したモデルから直接波形を生成します。どこで一時停止するか、どの単語を強調するか、質問がどのように上昇するかです。ElevenLabs と MiniMax の音声はイントネーションと感情を備えており、古いシステムの平坦な配信ではありません。
どの TTS エンジンを選ぶべきですか?
ElevenLabs TTS は大規模な自然な音声ライブラリを提供し、ナレーションの通常の第一選択肢です。MiniMax Speech 2.8 HD は表現力豊かな配信を目指し、Turbo バリアントは少しの洗練さを速度とコストと引き換えにするため、大量生成に適しています。Seed Audio 1.0 はさらに進み、1 つのプロンプトから音声と完全なサウンドシーンを一緒に生成します。
オーディオを商用利用できますか?
Arteza オーディオスタジオで生成したオーディオはプロジェクトで使用でき、商用利用も含まれます。プラットフォーム利用規約の対象となります。
TTS は自分の声で話せますか?
単独では不可能です。TTS はストック音声またはデザイン音声を使用します。ボイスクローニングと組み合わせてください。短いサンプルから音声をキャプチャし、任意のテキストをあなたとして話します。両方とも同じオーディオスタジオで実行されます。