APIXO expone dos niveles de MiniMax Speech 2.8: speech-2.8-turbo a través de Speech Turbo y speech-2.8-hd a través de Speech HD. No agrupa Speech 2.6, Speech-02, Speech-01 ni el flujo de trabajo separado de MiniMax Voice en esta ruta.
MiniMax Speech 2.8
MiniMax Speech 2.8 es la generación expresiva de texto a voz de MiniMax, lanzada con los niveles Speech 2.8 HD y Turbo. A través de APIXO, los desarrolladores pueden sintetizar audio multilingüe con ID de voz preestablecidos o personalizados creados previamente, etiquetas de sonido nativas, entrega emocional, anulaciones de pronunciación y controles de producción para el ritmo y la codificación de salida.
Modos de APIXO
Speech Turbo / HD
Precio
De $0.06 / 1K car.
Idiomas
40
Formatos
MP3 / WAV / PCM / FLAC
Lanzado
23 de ene. de 2026
Crear con MiniMax Speech 2.8
Cargando espacio de trabajo...
Controles de voz diseñados para una entrega expresiva
Etiquetas de sonido nativas
Speech 2.8 introduce interjecciones y eventos vocales modelados como respiraciones, risas, toses, suspiros y carraspeos. Estas señales ayudan a que el diálogo escrito incluya imperfecciones conversacionales en lugar de una entrega uniformemente pulida.
Interpretación emocional
APIXO expone siete direcciones emocionales: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised` y `neutral`. La emoción funciona con la voz y el guion seleccionados, por lo que los equipos deben evaluar la coherencia en pasajes completos.
Salida de voz más limpia
MiniMax posiciona Speech 2.8 en torno a la reducción del ruido de fondo y a la disminución de artefactos de audio sintéticos. El nivel HD está destinado a una entrega de mayor fidelidad cuando la claridad de la narración es más importante que el precio más bajo del nivel Turbo.
Síntesis multilingüe
La familia de modelos admite la síntesis de voz en 40 idiomas documentados. La configuración de refuerzo de idioma de APIXO proporciona una indicación explícita de pronunciación y prosodia, incluyendo cantonés y una amplia gama de idiomas europeos y asiáticos.
Selección de voz flexible
Utilice un ID de voz preestablecido y documentado de MiniMax o pase un ID de voz personalizado reutilizable creado previamente a través de MiniMax Voice. La ruta de síntesis consume esa identidad, pero no crea ni clona una voz por sí misma.
Anulaciones de pronunciación
APIXO expone un diccionario de pronunciación para términos que necesitan una forma hablada específica. Esto es útil para nombres de productos, abreviaturas, nombres poco comunes y vocabulario de dominio que no deberían depender únicamente de la pronunciación automática.
Elija entre iteración más rápida o voz de mayor fidelidad
Speech 2.8 Turbo para iteración eficiente
APIXO asigna Speech Turbo al nivel speech-2.8-turbo de MiniMax. Es la opción predeterminada de menor costo para vistas previas, guiones que cambian con frecuencia, mensajes de aplicaciones y flujos de trabajo donde los equipos necesitan síntesis expresiva sin la tarifa de HD.
Speech 2.8 HD para entrega final
h1Xyew
Controles de salida de Speech 2.8 en APIXO
Opciones de síntesis y codificación verificadas para la ruta pública actual.
10.000 caracteres
Límite de texto
Preset / ID Personalizado
Fuente de la voz
0.5–2.0
Velocidad
8 / 16 / 22.05 / 24 / 32 / 44.1 KHZ
Frecuencia de muestreo
32 / 64 / 128 / 256 KBPS
Tasa de bits
Mono / Estéreo
Canales
Flujos de Trabajo de Producción para MiniMax Speech 2.8
Experiencias de aplicación guiadas
Genere narraciones para onboarding, respuestas de asistentes, prompts de ayuda y notificaciones de voz usando una ID de voz preestablecida y probada o una personalizada. El modo Turbo permite una iteración rápida de guiones, mientras que las anulaciones de pronunciación ayudan a mantener la coherencia en la terminología del producto.
Narración y audiolibros
Convierta capítulos, artículos, explicaciones o guiones de pódcast en narraciones controladas. Divida los trabajos más largos en secciones revisadas para que el ritmo, la pronunciación, la emoción y el carácter de la voz se mantengan adecuados en toda la producción.
Audio para campañas multilingües
Sintetice anuncios localizados, lecciones, recorridos de productos y pistas de presentadores digitales con una indicación de idioma explícita. Revise los nombres, los pasajes con cambio de código, la pronunciación regional y el tono emocional con hablantes nativos antes del lanzamiento.
Diálogos de personajes y juegos
Aplique etiquetas de sonido y controles emocionales a las líneas de los personajes, diálogos con ramificaciones, escenarios educativos o narración para accesibilidad. Los ID de voz personalizados pueden dar soporte a personajes recurrentes cuando fueron creados por separado con material fuente autorizado.
Requisitos y límites de voz de Speech 2.8
Notas Importantes
APIXO requiere un modo de calidad, un ID de voz válido y un texto de síntesis no vacío. La longitud del prompt está limitada a 10 000 caracteres después del manejo de espacios en blanco.
La creación de voz personalizada pertenece a la ruta de voz de MiniMax por separado; este punto de acceso solo acepta un ID de voz personalizada existente.
APIXO documenta un procesamiento típico de 5 a 30 segundos, pero la latencia varía con la longitud del texto, el nivel, la carga de la cola y el estado de la ruta.
La ruta pública no expone audio de referencia, conversión de voz a voz, transmisión en tiempo real, subtítulos o alineación de marcas de tiempo.
La pronunciación, el cambio de código, la emoción y el carácter del hablante deben revisarse en pasajes completos en lugar de en líneas de muestra aisladas.
Un ID de voz personalizado técnicamente válido no establece el consentimiento ni los derechos comerciales sobre la voz subyacente.
Se pueden incrustar etiquetas de sonido expresivas como respiraciones, risas y suspiros en el texto del prompt para lograr un diálogo más natural.
Un voice_id personalizado técnicamente válido no establece el consentimiento ni los derechos comerciales sobre la voz subyacente.
Preguntas frecuentes
No. Puede sintetizar voz con un ID de voz personalizado compatible, pero no acepta audio de referencia ni crea esa identidad. Utilice primero el flujo de trabajo de voz de MiniMax por separado y luego pase el ID de voz autorizado resultante a Speech 2.8.
APIXO cobra por el texto enviado en lugar de por la duración final del audio. Speech Turbo cuesta $0.06 por cada 1000 caracteres del prompt, mientras que Speech HD cuesta $0.10 por cada 1000 caracteres del prompt.
APIXO expone `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised` y `neutral`. Los resultados dependen de la voz, la redacción, la puntuación, las etiquetas de sonido y la longitud del pasaje, por lo que una emoción seleccionada no debe tratarse como una interpretación garantizada.
La ruta pública de APIXO documenta la entrega de audio generado, pero no expone marcas de tiempo de frases, marcas de tiempo de palabras, alineación de fonemas o controles de subtítulos. Las aplicaciones que requieren subtítulos sincronizados deben agregar una etapa separada de alineación o transcripción.
Explorar otros modelos
Descubra más modelos de IA para su próximo flujo de trabajo creativo
