APIXO
Projektowanie głosuKlonowanie głosuID głosu wielokrotnego użytku

Usługa MiniMax Voice w APIXO tworzy niestandardowe ID głosu wielokrotnego użytku poprzez dwa odrębne procesy: projektowanie głosu na podstawie opisu tekstowego (Voice Design) oraz klonowanie głosu z pojedynczego nagrania (Voice Clone). Projektowanie zawsze obejmuje wymagany podgląd głosu, podczas gdy klonowanie może zwrócić próbkę audio, jeśli zostanie dostarczony tekst do podglądu. Uzyskane ID głosu może być następnie wielokrotnie używane do generowania mowy z tekstu (text-to-speech) za pośrednictwem oddzielnej usługi MiniMax Speech 2.8.

Tryby APIXO

Projektowanie / Klonowanie

Cena

$0.50 / żądanie

Wynik

ID głosu wielokrotnego użytku

Wejście do klonowania

Jeden URL audio

Dostępność

Dostępne na APIXO

Twórz z MiniMax Voice

Ładowanie przestrzeni roboczej...

Tworzenie niestandardowego głosu

Stwórz zasób głosowy przed wygenerowaniem narracji

Zdefiniuj nowy głos na podstawie cech opisanych tekstem lub sklonuj autoryzowanego mówcę z jednego nagrania referencyjnego. APIXO traktuje te operacje jako zadania tworzenia głosu, a nie finalne żądania narracji, zwracając re-używalny identyfikator, który można przekazać do MiniMax Speech 2.8 w celu późniejszej syntezy mowy.

Możliwości

Dwa sposoby na uzyskanie głosu MiniMax do wielokrotnego użytku

Projektowanie głosu na podstawie opisu tekstowego

Opisz pożądany akcent, pozorny wiek, ton, tempo, energię i przeznaczenie bez dostarczania źródłowego audio. MiniMax generuje niestandardowy głos i odczytuje podany tekst podglądu, aby można było ocenić wynik.

Klonowanie głosu z jednego klipu

Tryb klonowania tworzy re-używalną tożsamość głosową na podstawie dokładnie jednego publicznego adresu URL z nagraniem referencyjnym. Nagranie to służy jako źródło głosu mówcy, a nie jako treść mowy do konwersji lub dubbingu.

Zasób głosowy wielokrotnego użytku

Oba przepływy pracy zwracają ID głosu MiniMax zamiast samego gotowego pliku audio. Ten identyfikator można przechowywać i wybierać w kompatybilnych żądaniach syntezy w dalszych etapach, gdy potrzebny jest powracający narrator lub postać.

Podgląd przed syntezą

Projektowanie głosu (Voice Design) wymaga podania tekstu do podglądu i zwraca plik audio w celu oceny wygenerowanego głosu. Tryb klonowania (Clone) również może wygenerować próbkę audio, jeśli zostanie dostarczony opcjonalny tekst do podglądu, co pozwala zespołom na weryfikację wyniku przed szerszym wykorzystaniem do syntezy.

Kontrola czyszczenia klonu

APIXO udostępnia opcjonalną redukcję szumów i normalizację głośności dla nagrań referencyjnych do klonowania. Opcje te mogą poprawić przygotowanie źródła, gdy dozwolone nagranie ma niespójny poziom głośności lub możliwe do usunięcia szumy tła.

Wskazówki dotyczące rozpoznawania

Tryb klonowania zawiera wskazówkę językową i regulowaną kontrolę dokładności. Wskazówka pomaga w rozpoznawaniu mowy referencyjnej, podczas gdy dokładność pozwala aplikacjom dostroić żądane zachowanie klonowania w obsługiwanym zakresie APIXO.

Tryby tworzenia

Zaprojektuj oryginalny głos lub sklonuj autoryzowanego mówcę

Projektowanie głosu na podstawie opisu

Podaj opis głosu, tekst do podglądu i prawidłowy prefiks identyfikatora. Ten tryb jest odpowiedni dla fikcyjnych postaci i narratorów marki, ponieważ tworzy głos na podstawie żądanych cech, nie wymagając nagrania prawdziwego mówcy.

Brak wejścia audio

Klonowanie głosu z jednego nagrania

Podaj jeden publiczny adres URL do pliku MP3, M4A lub WAV z nagraniem mówcy, którego masz prawo powielać. Opcjonalne funkcje czyszczenia, rozpoznawania i kontroli dokładności przygotowują źródło, zanim APIXO zwróci ID sklonowanego głosu do wielokrotnego użytku. Podaj opcjonalny tekst do podglądu, jeśli potrzebujesz próbki audio do weryfikacji.

Dźwięk referencyjny
Specyfikacje

Wejścia głosowe MiniMax w APIXO

Każdy tryb ma oddzielne wymagania i powinien być implementowany niezależnie.

Opis + Podgląd

Dane wejściowe projektu

1–500 znaków

Podgląd projektu

Dokładnie jeden URL

Wejście do klonowania

MP3 / M4A / WAV

Formaty klonowania

0–1

Dokładność klonowania

Zaczyna się od litery · Min. 6 znaków

Prefiks ID głosu

Przykłady użycia

Twórz głosy wielokrotnego użytku dla systemów produkcyjnych

Branding dźwiękowy

Oryginalni narratorzy marki

Zaprojektuj głos na podstawie cech takich jak ciepło, autorytet, tempo, wiek i akcent, a następnie zweryfikuj go za pomocą reprezentatywnego podglądu. Uzyskany identyfikator może posłużyć jako fundament dla instruktaży produktowych, materiałów wyjaśniających i narracji w kampaniach, bez kopiowania prawdziwej osoby.

Autoryzowani lektorzy

Przepływy pracy z licencjonowanymi lektorami

Utwórz re-używalny głos na podstawie czystego nagrania dostarczonego z odpowiednią zgodą i warunkami użytkowania. Pozwala to na wykorzystanie głosu zatwierdzonego lektora lub wykonawcy w zlokalizowanych scenariuszach i powtarzalnych treściach, zachowując jednocześnie jawną autoryzację źródła.

Media interaktywne

Powtarzalne głosy postaci

Generuj unikalne głosy dla postaci w grach, asystentów edukacyjnych, cyfrowych prezenterów lub fikcyjnych asystentów. Zapisuj zwrócone identyfikatory wraz z metadanymi postaci, a następnie używaj oddzielnego punktu końcowego syntezy, gdy wymagane są nowe dialogi.

Dostępność

Spójne głosy lektorskie

Stwórz znajomy, niestandardowy głos na potrzeby materiałów edukacyjnych, wskazówek w interfejsie lub dostępnych treści do czytania. Sprawdzaj wymowę i ekspresję emocjonalną w dalszej syntezie, zwłaszcza gdy skrypty zmieniają język lub zawierają specjalistyczną terminologię.

Uwagi i FAQ

Tworzenie, aktywacja i prawa do głosu

Ważne uwagi

01

MiniMax Voice tworzy zasoby głosowe do wielokrotnego użytku; nie udostępnia bezpośrednich kontrolek do finalnej syntezy mowy (tekst na mowę).

02

Tryb projektowania wymaga opisu głosu, tekstu podglądu i prawidłowego prefiksu ID głosu.

03

Tryb klonowania wymaga dokładnie jednego publicznie dostępnego adresu URL z plikiem referencyjnym w formacie MP3, M4A lub WAV.

04

Nowo utworzony głos, który nie zostanie użyty do późniejszej syntezy, może stać się niedostępny po siedmiu dniach.

05

APIXO zaleca rozpoczęcie sprawdzania statusu około dziesięciu sekund po utworzeniu, jednak rzeczywisty czas przetwarzania może się różnić.

06

Klonuj tylko te głosy, do których przetwarzania i reprodukcji masz uprawnienia; pomyślne utworzenie nie stanowi zgody ani praw komercyjnych.

Często zadawane pytania

Tryb projektowania tworzy oryginalny, niestandardowy głos na podstawie pisemnego opisu i skryptu podglądu. Tryb klonowania natomiast tworzy głos na podstawie jednego nagrania referencyjnego. Oba tryby mają różne wymagania wejściowe, ale oba zwracają identyfikator głosu MiniMax do wielokrotnego użytku.

Nie. Ten punkt końcowy tworzy i udostępnia podgląd zasobu głosowego do wielokrotnego użytku. Przekaż jego identyfikator głosu (voice ID) do oddzielnego punktu końcowego MiniMax Speech 2.8 na APIXO, gdy potrzebujesz syntezować kompletną narrację, dialog lub mowę w aplikacji.

APIXO pobiera opłatę w wysokości $0.50 za każde przyjęte żądanie utworzenia projektu głosu (Voice Design) lub klonu głosu (Voice Clone). Późniejsze generowanie mowy z tekstu (text-to-speech) jest oddzielną operacją i podlega cennikowi opartemu na liczbie znaków wybranego wariantu MiniMax Speech 2.8.

Użyj wyraźnego, autoryzowanego nagrania skupionego na jednym mówcy. Muzyka, nakładające się głosy, długa cisza, silne echo, przesterowanie i intensywny hałas w tle mogą osłabić użyteczny sygnał mówcy, nawet jeśli plik zostanie technicznie zaakceptowany.

Tryb klonowania dostarcza wskazówek językowych dla wspieranych kontekstów rozpoznawania, a kompatybilne modele syntezy MiniMax mogą ponownie wykorzystywać niestandardowe ID głosu w różnych językach. Akcent, wymowa, tożsamość i charakter emocjonalny mogą ulec zmianie, dlatego wyniki w innych językach wymagają oceny uwzględniającej specyfikę mówcy.

Odkryj inne modele

Odkryj więcej modeli AI dla swojego kolejnego kreatywnego przepływu pracy