APIXO expose deux niveaux de MiniMax Speech 2.8 : speech-2.8-turbo via Speech Turbo et speech-2.8-hd via Speech HD. Il ne regroupe pas Speech 2.6, Speech-02, Speech-01, ni le flux de travail MiniMax Voice distinct dans cette route.
MiniMax Speech 2.8
MiniMax Speech 2.8 est la génération de synthèse vocale expressive de MiniMax, lancée avec les niveaux Speech 2.8 HD et Turbo. Via APIXO, les développeurs peuvent synthétiser de l'audio multilingue avec des ID de voix prédéfinis ou personnalisés créés précédemment, des balises sonores natives, une restitution émotionnelle, des remplacements de prononciation, et des contrôles de production pour le rythme et l'encodage de sortie.
Modes APIXO
Speech Turbo / HD
Prix
Sur $0.06 / 1K car.
Langues
40
Formats
MP3 / WAV / PCM / FLAC
Publié le
23 janv. 2026
Créer avec MiniMax Speech 2.8
Chargement de l'espace de travail...
Contrôles vocaux conçus pour un rendu expressif
Balises sonores natives
Speech 2.8 introduit des interjections et des événements vocaux modélisés tels que des respirations, des rires étouffés, des toux, des soupirs et des raclements de gorge. Ces indices aident à inclure dans les dialogues écrits des imperfections conversationnelles au lieu d'un rendu uniformément poli.
Performance Émotionnelle
APIXO expose sept directions émotionnelles : joyeux, triste, en colère, craintif, dégoûté, surpris et neutre. L'émotion fonctionne avec la voix et le script sélectionnés, les équipes doivent donc évaluer la cohérence sur des passages complets.
Sortie vocale plus nette
MiniMax positionne Speech 2.8 autour d'une réduction du bruit de fond et de moins d'artefacts audio synthétiques. Le niveau HD est destiné à une restitution de plus haute fidélité lorsque la clarté de la narration est plus importante que le prix inférieur du niveau Turbo.
Synthèse multilingue
La famille de modèles prend en charge la synthèse vocale dans 40 langues documentées. Le paramètre d'amélioration de la langue d'APIXO fournit une indication explicite de prononciation et de prosodie, incluant le cantonais et un large éventail de langues européennes et asiatiques.
Sélection de voix flexible
Utilisez un ID de voix prédéfini et documenté de MiniMax ou passez un ID de voix personnalisé réutilisable créé au préalable via MiniMax Voice. La route de synthèse consomme cette identité mais ne crée ni ne clone de voix elle-même.
Dérogations de prononciation
APIXO expose un dictionnaire de prononciation pour les termes qui nécessitent une forme orale spécifique. Ceci est utile pour les noms de produits, les abréviations, les noms peu courants et le vocabulaire de domaine qui ne devraient pas dépendre uniquement de la prononciation automatique.
Choisissez entre une itération plus rapide ou une parole de plus haute fidélité
Speech 2.8 Turbo pour une itération efficace
APIXO mappe Speech Turbo au niveau speech-2.8-turbo de MiniMax. C'est l'option par défaut à moindre coût pour les aperçus, les scripts fréquemment modifiés, les messages d'application et les flux de travail où les équipes ont besoin d'une synthèse vocale expressive sans le tarif HD.
Speech 2.8 HD pour la livraison finale
h1Xyew
Contrôles de sortie de Speech 2.8 sur APIXO
Options de synthèse et d'encodage vérifiées pour la route publique actuelle.
10 000 caractères
Limite de Texte
Préréglage / ID personnalisé
Source de la voix
0.5–2.0
Vitesse
8 / 16 / 22,05 / 24 / 32 / 44,1 KHZ
Taux d'échantillonnage
32 / 64 / 128 / 256 KBPS
Débit binaire
Mono / Stéréo
Canaux
Flux de production pour MiniMax Speech 2.8
Expériences d'application guidées
Générez une narration d'accueil, des réponses d'assistant, des aides contextuelles et des notifications vocales à l'aide d'un ID de voix prédéfini ou personnalisé. Le mode Turbo permet une itération rapide des scripts, tandis que les substitutions de prononciation aident à maintenir la cohérence de la terminologie du produit.
Narration et livres audio
Convertissez des chapitres, des articles, des explications ou des scripts de podcast en une narration contrôlée. Séparez les œuvres plus longues en sections révisées afin que le rythme, la prononciation, l'émotion et le caractère de la voix restent appropriés sur l'ensemble de la production.
Audio de campagne multilingue
Synthétisez des publicités, des leçons, des présentations de produits et des pistes de présentateur numérique localisées avec une indication de langue explicite. Révisez les noms, les passages en alternance codique, la prononciation régionale et le ton émotionnel avec des locuteurs natifs avant la publication.
Dialogues de personnages et de jeux
Appliquez des balises sonores et des contrôles émotionnels aux répliques de personnages, aux dialogues à embranchements, aux scénarios éducatifs ou à la narration pour l'accessibilité. Les identifiants de voix personnalisés peuvent prendre en charge des personnages récurrents lorsqu'ils ont été créés séparément avec du matériel source autorisé.
Exigences et limites vocales de Speech 2.8
Remarques importantes
APIXO exige un mode de qualité, un ID de voix valide et un texte de synthèse non vide. La longueur du prompt est limitée à 10 000 caractères après traitement des espaces.
La création de voix personnalisée appartient à la route distincte MiniMax Voice ; ce point de terminaison n'accepte qu'un ID de voix personnalisée existant.
APIXO documente un traitement typique de 5 à 30 secondes, mais la latence varie en fonction de la longueur du texte, du niveau de service, de la charge de la file d'attente et de l'état de la route.
La route publique n'expose pas l'audio de référence, la conversion parole à parole, la diffusion en temps réel, les sous-titres ou l'alignement d'horodatage.
La prononciation, l'alternance de code, l'émotion et le caractère du locuteur doivent être examinés sur des passages complets plutôt que sur des exemples de phrases isolées.
Un identifiant de voix personnalisé techniquement valide ne constitue pas un consentement ou des droits commerciaux sur la voix sous-jacente.
Des balises sonores expressives telles que des respirations, des gloussements et des soupirs peuvent être intégrées dans le texte du prompt pour un dialogue plus naturel.
Un voice_id personnalisé techniquement valide ne constitue pas un consentement ou des droits commerciaux sur la voix sous-jacente.
Foire Aux Questions
Non. Il peut synthétiser la parole avec un ID de voix personnalisé compatible, mais il n'accepte pas l'audio de référence ni ne crée cette identité. Utilisez d'abord le flux de travail distinct MiniMax Voice, puis transmettez l'ID de voix autorisé résultant à Speech 2.8.
APIXO facture le texte soumis plutôt que la durée finale de l'audio. Speech Turbo coûte $0.06 pour 1000 caractères de prompt, tandis que Speech HD coûte $0.10 pour 1000 caractères de prompt.
APIXO expose les émotions joyeux, triste, en colère, craintif, dégoûté, surpris et neutre. Les résultats dépendent de la voix, de la formulation, de la ponctuation, des balises sonores et de la longueur du passage, donc une émotion sélectionnée ne doit pas être traitée comme une performance garantie.
La route publique APIXO documente la livraison audio générée mais n'expose pas l'horodatage des phrases, l'horodatage des mots, l'alignement des phonèmes ou les contrôles de sous-titres. Les applications nécessitant des légendes synchronisées devraient ajouter une étape distincte d'alignement ou de transcription.
Explorer d'autres modèles
Découvrez d'autres modèles d'IA pour votre prochain workflow créatif
