APIXOは2つのMiniMax Speech 2.8ティアを公開しています:Speech Turboを通じてspeech-2.8-turboを、Speech HDを通じてspeech-2.8-hdを提供します。このルートにはSpeech 2.6、Speech-02、Speech-01、または別のMiniMax Voiceワークフローは含まれていません。
MiniMax Speech 2.8
MiniMax Speech 2.8は、Speech 2.8 HDおよびTurboティアと共にリリースされた、MiniMaxの表現力豊かなテキスト読み上げ生成モデルです。APIXOを通じて、開発者はプリセットまたは事前に作成したカスタムボイスID、ネイティブサウンドタグ、感情表現、発音のオーバーライド、そしてペース配分や出力エンコーディングのための制作コントロールを使用して、多言語の音声を合成できます。
APIXOモード
Speech Turbo / HD
価格
$0.06/1000文字から
言語
40
フォーマット
MP3 / WAV / PCM / FLAC
リリース日
2026年1月23日
MiniMax Speech 2.8で作成
ワークスペースを読み込み中...
表現力豊かな表現のために構築された音声制御
ネイティブサウンドタグ
Speech 2.8では、息継ぎ、含み笑い、咳、ため息、咳払いなど、モデル化された間投詞や声のイベントが導入されました。これらの手がかりにより、書き言葉の対話に、均一に洗練された表現ではなく、会話特有の不完全さを含めることができます。
感情表現
APIXOは7つの感情の方向性(happy、sad、angry、fearful、disgusted、surprised、neutral)を公開しています。感情は選択されたボイスやスクリプトと連動して機能するため、チームは完全な文章全体での一貫性を評価する必要があります。
よりクリーンなボーカル出力
MiniMaxは、Speech 2.8を背景ノイズの低減と合成音声特有の不自然さの削減に重点を置いて位置付けています。HDティアは、低価格なTurboティアよりもナレーションの明瞭性が重要な場合に、より忠実度の高い音声を提供することを目的としています。
クロスリンガル合成
このモデルファミリーは、ドキュメントに記載されている40言語の音声合成をサポートしています。APIXOのlanguage-boost設定は、広東語や幅広いヨーロッパおよびアジアの言語を含む、明示的な発音と韻律のヒントを提供します。
柔軟な音声選択
ドキュメントに記載されたMiniMaxのプリセットボイスIDを使用するか、事前にMiniMax Voiceで作成した再利用可能なカスタムボイスIDを渡してください。この合成ルートはそのアイデンティティを消費しますが、ボイス自体を生成またはクローンするわけではありません。
発音のオーバーライド
APIXOは、特定の発音が必要な用語のための発音辞書を公開しています。これは、製品名、略語、珍しい名前、および自動発音だけに頼るべきでない専門用語に役立ちます。
高速なイテレーションまたは忠実度の高い音声を選択
効率的なイテレーションのためのSpeech 2.8 Turbo
APIXOは、Speech TurboをMiniMaxのspeech-2.8-turboティアにマッピングします。これは、プレビュー、頻繁に変更されるスクリプト、アプリケーションメッセージ、およびHDレートなしで表現力豊かな合成を必要とするワークフロー向けの、デフォルトの低コストオプションです。
最終納品用のSpeech 2.8 HD
h1Xyew
APIXOでのSpeech 2.8出力制御
現在の公開ルートで利用可能な、検証済みの合成およびエンコーディングオプション。
10,000文字
文字数制限
プリセット / カスタムID
音声ソース
0.5~2.0
速度
8 / 16 / 22.05 / 24 / 32 / 44.1 KHZ
サンプルレート
32 / 64 / 128 / 256 KBPS
ビットレート
モノラル / ステレオ
チャンネル
MiniMax Speech 2.8のプロダクションワークフロー
ガイド付きアプリ体験
テスト済みのプリセットまたはカスタム音声IDを使用して、オンボーディングのナレーション、アシスタントの応答、ヘルププロンプト、音声通知を生成します。Turboは迅速なスクリプトの反復をサポートし、発音のオーバーライドは製品用語の一貫性を保つのに役立ちます。
ナレーションとオーディオブック
章、記事、解説、ポッドキャストの台本などを、制御されたナレーションに変換します。長い作品をレビュー済みのセクションに分割することで、作品全体を通してペース、発音、感情、声のキャラクターを適切に保つことができます。
多言語キャンペーン音声
言語のヒントを明示的に指定して、ローカライズされた広告、レッスン、製品ツアー、デジタルプレゼンターのトラックを合成します。リリース前に、名前、コードスイッチングされた箇所、地域的な発音、感情のトーンをネイティブスピーカーと確認してください。
キャラクターとゲームのセリフ
キャラクターのセリフ、分岐する対話、教育シナリオ、またはアクセシビリティナレーションに、サウンドタグや感情コントロールを適用します。カスタム音声IDは、許諾されたソース素材で別途作成された場合に、繰り返し登場するキャラクターをサポートできます。
Speech 2.8の要件と音声の境界
重要事項
APIXOでは、品質モード、有効な音声ID、および空でない合成テキストが必要です。プロンプトの長さは、空白文字の処理後、10,000文字に制限されています。
カスタムボイスの作成は、別のMiniMax Voiceルートに属します。このエンドポイントは、既存のカスタムボイスIDのみを受け付けます。
APIXOのドキュメントでは、標準的な処理時間は5〜30秒と記載されていますが、レイテンシはテキストの長さ、ティア、キューの負荷、およびルートの状態によって変動します。
公開ルートでは、参照音声、音声から音声への変換、リアルタイムストリーミング、字幕、タイムスタンプのアライメントは公開されていません。
発音、コードスイッチング、感情、話者のキャラクターは、個別のサンプルセリフではなく、文章全体を通してレビューする必要があります。
技術的に有効なカスタムボイスIDは、その元となる音声に対する同意や商業的権利を確立するものではありません。
息づかい、含み笑い、ため息などの表現豊かなサウンドタグをプロンプトテキストに埋め込むことで、より自然な対話を作成できます。
技術的に有効なカスタムvoice_idは、その元となる音声に対する同意や商用利用権を確立するものではありません。
よくある質問
いいえ。互換性のあるカスタムボイスIDを使用して音声を合成することはできますが、参照音声を受け付けたり、そのIDを作成したりすることはできません。まず、個別のMiniMax Voiceワークフローを使用してから、結果として得られた承認済みのボイスIDをSpeech 2.8に渡してください。
APIXOは、最終的な音声の再生時間ではなく、送信されたテキストに基づいて課金します。Speech Turboはプロンプト1,000文字あたり$0.06、Speech HDはプロンプト1,000文字あたり$0.10の費用がかかります。
APIXOは、happy、sad、angry、fearful、disgusted、surprised、neutralを公開しています。結果はボイス、言葉遣い、句読点、サウンドタグ、文章の長さに依存するため、選択された感情が保証されたパフォーマンスとして扱われるべきではありません。
公開されているAPIXOルートは生成された音声の配信について記載していますが、文のタイムスタンプ、単語のタイムスタンプ、音素のアライメント、または字幕の制御は公開していません。同期されたキャプションを必要とするアプリケーションは、別途アライメントまたは文字起こしの段階を追加する必要があります。
他のモデルを見る
次のクリエイティブワークフローのために、さらに多くのAIモデルを発見しましょう
