Tryb projektowania tworzy oryginalny, niestandardowy głos na podstawie pisemnego opisu i skryptu podglądu. Tryb klonowania natomiast tworzy głos na podstawie jednego nagrania referencyjnego. Oba tryby mają różne wymagania wejściowe, ale oba zwracają identyfikator głosu MiniMax do wielokrotnego użytku.
Usługa MiniMax Voice w APIXO tworzy niestandardowe ID głosu wielokrotnego użytku poprzez dwa odrębne procesy: projektowanie głosu na podstawie opisu tekstowego (Voice Design) oraz klonowanie głosu z pojedynczego nagrania (Voice Clone). Projektowanie zawsze obejmuje wymagany podgląd głosu, podczas gdy klonowanie może zwrócić próbkę audio, jeśli zostanie dostarczony tekst do podglądu. Uzyskane ID głosu może być następnie wielokrotnie używane do generowania mowy z tekstu (text-to-speech) za pośrednictwem oddzielnej usługi MiniMax Speech 2.8.
Tryby APIXO
Projektowanie / Klonowanie
Cena
$0.50 / żądanie
Wynik
ID głosu wielokrotnego użytku
Wejście do klonowania
Jeden URL audio
Dostępność
Dostępne na APIXO
Twórz z MiniMax Voice
Ładowanie przestrzeni roboczej...
Dwa sposoby na uzyskanie głosu MiniMax do wielokrotnego użytku
Projektowanie głosu na podstawie opisu tekstowego
Opisz pożądany akcent, pozorny wiek, ton, tempo, energię i przeznaczenie bez dostarczania źródłowego audio. MiniMax generuje niestandardowy głos i odczytuje podany tekst podglądu, aby można było ocenić wynik.
Klonowanie głosu z jednego klipu
Tryb klonowania tworzy re-używalną tożsamość głosową na podstawie dokładnie jednego publicznego adresu URL z nagraniem referencyjnym. Nagranie to służy jako źródło głosu mówcy, a nie jako treść mowy do konwersji lub dubbingu.
Zasób głosowy wielokrotnego użytku
Oba przepływy pracy zwracają ID głosu MiniMax zamiast samego gotowego pliku audio. Ten identyfikator można przechowywać i wybierać w kompatybilnych żądaniach syntezy w dalszych etapach, gdy potrzebny jest powracający narrator lub postać.
Podgląd przed syntezą
Projektowanie głosu (Voice Design) wymaga podania tekstu do podglądu i zwraca plik audio w celu oceny wygenerowanego głosu. Tryb klonowania (Clone) również może wygenerować próbkę audio, jeśli zostanie dostarczony opcjonalny tekst do podglądu, co pozwala zespołom na weryfikację wyniku przed szerszym wykorzystaniem do syntezy.
Kontrola czyszczenia klonu
APIXO udostępnia opcjonalną redukcję szumów i normalizację głośności dla nagrań referencyjnych do klonowania. Opcje te mogą poprawić przygotowanie źródła, gdy dozwolone nagranie ma niespójny poziom głośności lub możliwe do usunięcia szumy tła.
Wskazówki dotyczące rozpoznawania
Tryb klonowania zawiera wskazówkę językową i regulowaną kontrolę dokładności. Wskazówka pomaga w rozpoznawaniu mowy referencyjnej, podczas gdy dokładność pozwala aplikacjom dostroić żądane zachowanie klonowania w obsługiwanym zakresie APIXO.
Zaprojektuj oryginalny głos lub sklonuj autoryzowanego mówcę
Projektowanie głosu na podstawie opisu
Podaj opis głosu, tekst do podglądu i prawidłowy prefiks identyfikatora. Ten tryb jest odpowiedni dla fikcyjnych postaci i narratorów marki, ponieważ tworzy głos na podstawie żądanych cech, nie wymagając nagrania prawdziwego mówcy.
Klonowanie głosu z jednego nagrania
Podaj jeden publiczny adres URL do pliku MP3, M4A lub WAV z nagraniem mówcy, którego masz prawo powielać. Opcjonalne funkcje czyszczenia, rozpoznawania i kontroli dokładności przygotowują źródło, zanim APIXO zwróci ID sklonowanego głosu do wielokrotnego użytku. Podaj opcjonalny tekst do podglądu, jeśli potrzebujesz próbki audio do weryfikacji.
Wejścia głosowe MiniMax w APIXO
Każdy tryb ma oddzielne wymagania i powinien być implementowany niezależnie.
Opis + Podgląd
Dane wejściowe projektu
1–500 znaków
Podgląd projektu
Dokładnie jeden URL
Wejście do klonowania
MP3 / M4A / WAV
Formaty klonowania
0–1
Dokładność klonowania
Zaczyna się od litery · Min. 6 znaków
Prefiks ID głosu
Twórz głosy wielokrotnego użytku dla systemów produkcyjnych
Oryginalni narratorzy marki
Zaprojektuj głos na podstawie cech takich jak ciepło, autorytet, tempo, wiek i akcent, a następnie zweryfikuj go za pomocą reprezentatywnego podglądu. Uzyskany identyfikator może posłużyć jako fundament dla instruktaży produktowych, materiałów wyjaśniających i narracji w kampaniach, bez kopiowania prawdziwej osoby.
Przepływy pracy z licencjonowanymi lektorami
Utwórz re-używalny głos na podstawie czystego nagrania dostarczonego z odpowiednią zgodą i warunkami użytkowania. Pozwala to na wykorzystanie głosu zatwierdzonego lektora lub wykonawcy w zlokalizowanych scenariuszach i powtarzalnych treściach, zachowując jednocześnie jawną autoryzację źródła.
Powtarzalne głosy postaci
Generuj unikalne głosy dla postaci w grach, asystentów edukacyjnych, cyfrowych prezenterów lub fikcyjnych asystentów. Zapisuj zwrócone identyfikatory wraz z metadanymi postaci, a następnie używaj oddzielnego punktu końcowego syntezy, gdy wymagane są nowe dialogi.
Spójne głosy lektorskie
Stwórz znajomy, niestandardowy głos na potrzeby materiałów edukacyjnych, wskazówek w interfejsie lub dostępnych treści do czytania. Sprawdzaj wymowę i ekspresję emocjonalną w dalszej syntezie, zwłaszcza gdy skrypty zmieniają język lub zawierają specjalistyczną terminologię.
Tworzenie, aktywacja i prawa do głosu
Ważne uwagi
MiniMax Voice tworzy zasoby głosowe do wielokrotnego użytku; nie udostępnia bezpośrednich kontrolek do finalnej syntezy mowy (tekst na mowę).
Tryb projektowania wymaga opisu głosu, tekstu podglądu i prawidłowego prefiksu ID głosu.
Tryb klonowania wymaga dokładnie jednego publicznie dostępnego adresu URL z plikiem referencyjnym w formacie MP3, M4A lub WAV.
Nowo utworzony głos, który nie zostanie użyty do późniejszej syntezy, może stać się niedostępny po siedmiu dniach.
APIXO zaleca rozpoczęcie sprawdzania statusu około dziesięciu sekund po utworzeniu, jednak rzeczywisty czas przetwarzania może się różnić.
Klonuj tylko te głosy, do których przetwarzania i reprodukcji masz uprawnienia; pomyślne utworzenie nie stanowi zgody ani praw komercyjnych.
Często zadawane pytania
Nie. Ten punkt końcowy tworzy i udostępnia podgląd zasobu głosowego do wielokrotnego użytku. Przekaż jego identyfikator głosu (voice ID) do oddzielnego punktu końcowego MiniMax Speech 2.8 na APIXO, gdy potrzebujesz syntezować kompletną narrację, dialog lub mowę w aplikacji.
APIXO pobiera opłatę w wysokości $0.50 za każde przyjęte żądanie utworzenia projektu głosu (Voice Design) lub klonu głosu (Voice Clone). Późniejsze generowanie mowy z tekstu (text-to-speech) jest oddzielną operacją i podlega cennikowi opartemu na liczbie znaków wybranego wariantu MiniMax Speech 2.8.
Użyj wyraźnego, autoryzowanego nagrania skupionego na jednym mówcy. Muzyka, nakładające się głosy, długa cisza, silne echo, przesterowanie i intensywny hałas w tle mogą osłabić użyteczny sygnał mówcy, nawet jeśli plik zostanie technicznie zaakceptowany.
Tryb klonowania dostarcza wskazówek językowych dla wspieranych kontekstów rozpoznawania, a kompatybilne modele syntezy MiniMax mogą ponownie wykorzystywać niestandardowe ID głosu w różnych językach. Akcent, wymowa, tożsamość i charakter emocjonalny mogą ulec zmianie, dlatego wyniki w innych językach wymagają oceny uwzględniającej specyfikę mówcy.
Odkryj inne modele
Odkryj więcej modeli AI dla swojego kolejnego kreatywnego przepływu pracy
