APIXO
文字转语音多语言音频自定义声音 ID

MiniMax Speech 2.8 是 MiniMax 发布的富有表现力的文字转语音生成模型,分为 Speech 2.8 HD 和 Turbo 两种级别。通过 APIXO,开发者可以使用预设或之前创建的自定义声音 ID、原生音效标签、情感化表达、发音覆盖以及用于控制节奏和输出编码的制作功能,来合成多语言音频。

APIXO 模式

Speech Turbo / HD

价格

始于 $0.06 / 1000 字符

语言

40

格式

MP3 / WAV / PCM / FLAC

发布于

2026年1月23日

使用 MiniMax Speech 2.8 创作

正在加载工作区...

由 APIXO 驱动

将富有表现力的 MiniMax Speech 2.8 添加到语音产品中

将长达 10,000 个字符的脚本转换为语音,同时控制音色、情感、发音、语速、音高、音量、语言处理和音频编码。APIXO 在一个异步文字转语音路由中,结合了速度更快的 Speech 2.8 Turbo 层级和保真度更高的 HD 层级。

能力

为生动表达而构建的语音控制

原生音效标签

Speech 2.8 引入了模拟的插入语和人声事件,如呼吸、轻笑、咳嗽、叹气和清嗓子。这些提示有助于在书面对白中加入对话式的瑕疵,而不是千篇一律的完美表达。

情感表现

APIXO 提供七种情绪方向:高兴、悲伤、愤怒、恐惧、厌恶、惊讶和中性。情绪与所选的声音和脚本协同作用,因此团队应评估其在完整段落中的一致性。

更纯净的人声输出

MiniMax 将 Speech 2.8 定位于减少背景噪音和合成音频瑕疵。当旁白清晰度比 Turbo 层的低价更重要时,HD 层旨在提供更高保真度的交付。

跨语言合成

该模型系列支持文档中记录的 40 种语言的语音合成。APIXO 的 language-boost 设置提供了明确的发音和韵律提示,支持包括粤语在内的多种欧洲和亚洲语言。

灵活的语音选择

使用已记录的 MiniMax 预设语音 ID,或传入通过 MiniMax Voice 事先创建的可复用自定义语音 ID。该合成路径会使用该身份,但本身不创建或克隆语音。

发音覆盖

APIXO 提供发音词典功能,用于需要特定发音形式的术语。这对于产品名称、缩写、不常见的名字以及不应仅依赖自动发音的领域词汇非常有用。

质量等级

选择快速迭代或高保真语音

用于高效迭代的 Speech 2.8 Turbo

APIXO 将 Speech Turbo 映射到 MiniMax 的 speech-2.8-turbo 层级。它是用于预览、频繁更改的脚本、应用程序消息以及需要富有表现力的合成效果但无需 HD 费率的工作流的默认低成本选项。

$0.06 / 1千字符

用于最终交付的 Speech 2.8 HD

h1Xyew

$0.10 / 1千字符
规格

APIXO 上的 Speech 2.8 输出控制

经当前公开路径验证的合成与编码选项。

10,000 字符

文本限制

预设 / 自定义 ID

声音来源

0.5–2.0

语速

8 / 16 / 22.05 / 24 / 32 / 44.1 KHZ

采样率

32 / 64 / 128 / 256 KBPS

比特率

单声道 / 立体声

声道

应用场景

MiniMax Speech 2.8 生产工作流

产品之声

引导式应用体验

使用经过测试的预设或自定义语音 ID,生成产品引导旁白、助手回复、帮助提示和语音通知。Turbo 模式支持快速脚本迭代,而发音覆盖功能则有助于保持产品术语的一致性。

长篇媒体内容

旁白和有声读物

将章节、文章、解说词或播客脚本转换为可控的旁白。将较长的作品分解为经审校的片段,确保在整个作品中保持适当的节奏、发音、情感和声音特征。

本地化

多语言营销活动音频

通过明确的语言提示,合成适用于本地市场的广告、课程、产品演示和数字人解说音轨。发布前,请与母语者一同审核人名、中英夹杂的段落、地区性发音和情感语调。

互动媒体

角色与游戏对话

将声音标签和情感控制应用于角色台词、分支对话、教育场景或无障碍旁白。当角色是使用授权的源材料单独创建时,自定义语音 ID 可以支持这些角色的重复出现。

说明与常见问题

Speech 2.8 的要求和声音边界

重要说明

01

APIXO 要求提供质量模式、有效的语音 ID 和非空的合成文本。处理完空白字符后,提示词长度上限为 10000 个字符。

02

自定义声音创建属于独立的 MiniMax Voice 路由;此接口地址仅接受已有的自定义声音 ID。

03

APIXO 的文档指出,典型处理时间为 5-30 秒,但延迟会因文本长度、层级、队列负载和路由健康状况而异。

04

该公共路由不提供参考音频、语音到语音转换、实时流式传输、字幕或时间戳对齐功能。

05

发音、语码转换、情感和说话人特征应在完整段落中进行审核,而不是孤立的样句。

06

技术上有效的自定义语音 ID 并不代表您已获得该声音的同意使用权或商业权利。

07

可以在提示词文本中嵌入如呼吸、轻笑、叹息等表达性声音标签,以生成更自然的对话。

08

一个技术上有效的自定义 voice_id 并不代表您已获得对该语音的同意或商业使用权。

常见问题解答

APIXO 提供两种 MiniMax Speech 2.8 层级:通过 Speech Turbo 提供 speech-2.8-turbo,通过 Speech HD 提供 speech-2.8-hd。此路由不包含 Speech 2.6、Speech-02、Speech-01 或独立的 MiniMax Voice 工作流程。

否。它可以使用兼容的自定义声音 ID 合成语音,但它不接受参考音频或创建该身份。请先使用独立的 MiniMax Voice 工作流,然后将获得的授权声音 ID 传递给 Speech 2.8。

APIXO 根据提交的文本而非最终音频时长计费。Speech Turbo 每 1000 个提示词字符收费 $0.06,Speech HD 每 1000 个提示词字符收费 $0.10。

APIXO 提供高兴、悲伤、愤怒、恐惧、厌恶、惊讶和中性七种情绪。结果取决于声音、措辞、标点、声音标签和段落长度,因此所选情绪不应被视为效果的保证。

APIXO 的公共路由文档说明了如何获取生成的音频,但未提供句子时间戳、单词时间戳、音素对齐或字幕控制等功能。需要同步字幕的应用应额外增加一个对齐或转录步骤。

探索其他模型

探索更多 AI 模型,赋能您的创意工作流