Режим «Дизайн» создаёт оригинальный пользовательский голос на основе письменного описания и скрипта для превью. Режим «Клонирование» создаёт голос на основе одной эталонной записи. Эти два режима требуют разных входных данных, но оба возвращают многоразовый ID голоса MiniMax.
MiniMax Voice на APIXO создает многоразовые пользовательские идентификаторы голосов через два различных процесса: Voice Design (дизайн голоса) по текстовому описанию и Voice Clone (клонирование голоса) из одного аудиофрагмента. Дизайн включает обязательный предварительный просмотр голоса, в то время как клонирование может вернуть аудио для предпрослушивания, если предоставлен текст. Полученный идентификатор голоса можно использовать для последующего синтеза речи через отдельный маршрут MiniMax Speech 2.8.
Режимы APIXO
Дизайн / Клонирование
Цена
$0.50 / запрос
Результат
Многоразовый ID голоса
Входные данные для клонирования
URL одного аудиофайла
Доступность
Доступно на APIXO
Создать с MiniMax Voice
Загрузка рабочего пространства...
Два пути к многоразовому голосу MiniMax
Создание голоса по текстовому описанию
Опишите желаемый акцент, предполагаемый возраст, тон, темп, энергичность и предполагаемое использование без предоставления исходного аудио. MiniMax сгенерирует кастомный голос и зачитает предоставленный текст для предварительного просмотра, чтобы можно было оценить результат.
Клонирование голоса по одному клипу
Режим клонирования создаёт многократно используемый идентификатор голоса на основе одной общедоступной URL-ссылки на эталонный аудиофайл. Запись служит источником голоса говорящего, а не контентом для преобразования или дубляжа.
Многоразовый голосовой ресурс
Оба рабочих процесса возвращают идентификатор голоса MiniMax, а не только готовый аудиофайл. Этот идентификатор можно сохранить и использовать в последующих совместимых запросах на синтез речи, когда требуется повторяющийся диктор или персонаж.
Предпросмотр перед синтезом
Для Voice Design требуется текст для предпрослушивания, по которому возвращается аудио для оценки сгенерированного голоса. Режим клонирования также может создавать аудио для предпрослушивания, если указан соответствующий текст, что позволяет командам оценить результат перед его широким использованием в синтезе.
Элементы управления для очистки клона
APIXO предоставляет опциональное шумоподавление и нормализацию громкости для эталонных записей клона. Эти инструменты могут улучшить подготовку исходного материала, если разрешённая запись содержит непостоянный уровень громкости или умеренный фоновый шум.
Инструкции по распознаванию
Режим клонирования включает подсказку по языку и настраиваемый контроль точности. Подсказка помогает распознавать референсную речь, а точность позволяет приложениям настраивать желаемое поведение клонирования в пределах диапазона, поддерживаемого APIXO.
Создайте оригинальный голос или клонируйте авторизованного диктора
Дизайн голоса по письменному описанию
Укажите описание голоса, текст для предпрослушивания и действительный префикс идентификатора. Этот режим подходит для вымышленных персонажей и голосов бренда, так как он создаёт голос по заданным характеристикам без необходимости записи реального диктора.
Клонирование голоса из одной записи
Предоставьте одну общедоступную ссылку на URL в формате MP3, M4A или WAV с речью диктора, на воспроизведение голоса которого у вас есть разрешение. Опциональные параметры очистки, распознавания и контроля точности подготавливают источник перед тем, как APIXO вернет многоразовый идентификатор клонированного голоса. Укажите необязательный текст для предварительного просмотра, если для проверки требуется аудиообразец.
Голосовой ввод MiniMax на APIXO
Каждый режим имеет отдельные требования и должен реализовываться независимо.
Описание + Предпросмотр
Входные данные для дизайна
1–500 символов
Предпросмотр дизайна
Строго один URL
Входные данные для клонирования
MP3 / M4A / WAV
Форматы клонирования
0–1
Точность клонирования
Начинается с буквы · 6+ симв.
Префикс ID голоса
Создавайте голоса для многократного использования в производственных системах
Оригинальные дикторы бренда
Создайте голос с заданными чертами, такими как теплота, авторитетность, темп, возраст и акцент, а затем оцените его с помощью репрезентативного превью. Полученный ID можно использовать для озвучивания продуктовых туров, объясняющих видео и рекламных кампаний без копирования реального человека.
Рабочие процессы с лицензированными дикторами
Создайте многократно используемый голос из чистой записи, предоставленной с соответствующим согласием и на условиях использования. Это позволяет использовать голос утверждённого диктора или исполнителя в локализованных сценариях и повторяющемся контенте, сохраняя при этом явную авторизацию источника.
Повторяющиеся голоса персонажей
Сгенерируйте уникальные голоса для игровых персонажей, обучающих компаньонов, цифровых ведущих или вымышленных ассистентов. Сохраняйте полученные идентификаторы вместе с метаданными персонажей, а затем используйте отдельный маршрут синтеза, когда требуются новые диалоги.
Единообразные голоса для чтения
Создайте узнаваемый пользовательский голос для учебных материалов, инструкций в интерфейсе или для озвучивания текстов в целях доступности. Проверяйте произношение и эмоциональную окраску при последующем синтезе, особенно когда скрипты меняют язык или содержат специальную терминологию.
Создание, активация и права на голос
Важные примечания
MiniMax Voice создает многоразовые голосовые ресурсы; он не предоставляет элементы управления для финального синтеза речи (text-to-speech).
Режим «Дизайн» требует описания голоса, текста для предпросмотра и валидного префикса для ID голоса.
Для режима клонирования требуется одна общедоступная URL-ссылка на эталонную запись в формате MP3, M4A или WAV.
Если созданный голос не используется для последующего синтеза, он может стать недоступным через семь дней.
APIXO рекомендует начинать проверку статуса примерно через десять секунд после создания, но фактическое время обработки может варьироваться.
Клонируйте только те голоса, которые вы уполномочены обрабатывать и воспроизводить; успешное создание не означает получение согласия или коммерческих прав.
Часто задаваемые вопросы
Нет. Этот маршрут создает и предпрослушивает многоразовый голосовой ресурс. Передайте его ID голоса в отдельный маршрут MiniMax Speech 2.8 на APIXO, когда вам нужно будет синтезировать полную озвучку, диалог или речь для приложения.
APIXO взимает $0.50 за каждый принятый запрос на создание Voice Design или Voice Clone. Последующий синтез речи является отдельной операцией и тарифицируется посимвольно в соответствии с выбранным уровнем MiniMax Speech 2.8.
Используйте четкую, авторизованную запись с фокусом на одном дикторе. Музыка, наложение голосов, длинные паузы, сильное эхо, искажения и сильный фоновый шум могут ослабить полезный сигнал голоса, даже если файл технически принят.
Режим клонирования предоставляет языковые подсказки для поддерживаемых контекстов распознавания, а совместимые модели синтеза MiniMax могут использовать пользовательские идентификаторы голосов для разных языков. Акцент, произношение, идентичность и эмоциональная окраска могут меняться, поэтому межъязыковые результаты требуют проверки носителем языка.
Другие модели
Откройте для себя больше AI-моделей для вашего следующего творческого процесса
