Tak. Model jest dostępny na asynchronicznym punkcie końcowym APIXO i można go wywoływać za pomocą tego samego klucza API, co każdy inny model w katalogu. Generowanie jest również dostępne w Playground na tej stronie.
MiniMax H3 to multimodalny model wideo ogólnego przeznaczenia, który łączy kontekst tekstowy, obrazowy, wideo i audio w jednym przepływie pracy generowania. Tworzy filmy o długości do 15 sekund w rozdzielczości 2K z natywnym dźwiękiem stereo, jednocześnie obsługując kontrolę pierwszej i ostatniej klatki, referencje z różnych mediów, przenoszenie ruchu, opowiadanie historii w wielu ujęciach oraz edycję wideo kierowaną instrukcjami.
Wejścia
Tekst / Obraz / Wideo / Audio
Cena APIXO
$0.09–$0.13 / sekundę
Rozdzielczość
768p / 2K
Czas trwania
5-15 sekund
Audio
Natywny dźwięk stereo
Ładowanie przestrzeni roboczej...
Połącz pisemne wskazówki z referencjami obrazu, wideo i audio w jednym żądaniu. Przypisz każdemu źródłu rolę, taką jak wygląd, ruch, kamera, głos, rytm, otoczenie lub styl.
Zdefiniuj klatkę początkową, końcową lub obie, aby kierować transformacjami, przejściami, prezentacjami produktów i kluczowymi momentami scenariusza, zachowując wyraźniejszą trajektorię wizualną.
Używaj razem referencyjnych obrazów, filmów i dźwięków, aby przekazać tożsamość postaci, cechy produktu, ruch, język kamery, wykonanie wokalne, muzykę lub atmosferę.
Generuj głos, efekty dźwiękowe, tło i muzykę razem z wideo jako natywny dźwięk stereo, zamiast składać osobne ścieżki audio po wygenerowaniu.
Twórz krótkie sekwencje ze skoordynowanymi zmianami ujęć, progresją scen, ciągłością akcji i tempem audiowizualnym w ramach jednego przepływu pracy opartego na prompcie lub referencjach.
Przekształcaj istniejące materiały wizualne za pomocą poleceń w języku naturalnym lub przenoś ruch z referencji wideo, jednocześnie weryfikując tożsamość, kompozycję, okluzję i wierność detali ze źródła.
Połącz obrazy produktów, pisemne wskazówki, referencje ruchu i zamierzenia dźwiękowe, aby rozwijać koncepcje kampanii. Przejrzyj etykiety, logo, materiały, wymiary i geometrię produktu przed zatwierdzeniem wygenerowanych zasobów komercyjnych.
Ustal powtarzający się obiekt za pomocą referencji wizualnych, a następnie kieruj ruchem, zachowaniem kamery, głosem lub kontekstem sceny za pomocą dodatkowych mediów. Oceń ciągłość tożsamości, anatomię, ekspresję i synchronizację wykonania w całym rezultacie.
Przekładaj treatment na krótkie sceny, które łączą akcję, język kamery, atmosferę i tempo audiowizualne. Wykorzystaj wygenerowany materiał do oceny pomysłów przed zaangażowaniem się w fizyczną produkcję lub szczegółową postprodukcję.
Eksploruj zmiany stylu, otoczenia, obiektu lub sceny za pomocą instrukcji w języku naturalnym i opcjonalnych referencji. Sprawdzaj klatka po klatce granice czasowe, okluzję, niezamierzone modyfikacje i zachowanie szczegółów źródłowych.
Potwierdzone na działającym wdrożeniu APIXO.
Tekst / Obraz / Wideo / Audio
Wejście
T2V / I2V / Referencje
Przepływy pracy
768p / 2K
Rozdzielczość
5–15 sekund
Czas trwania
Natywne stereo
Audio
6 proporcji + adaptacyjne
Kadrowanie
MiniMax H3 działa na asynchronicznym punkcie końcowym zadań APIXO. Prześlij zadanie do generateTask i odpytuj statusTask lub podaj adres URL wywołania zwrotnego (callback) w celu dostarczenia wyniku przez webhook.
Udostępniamy trzy tryby: tekst na wideo, obraz na wideo i reference-to-video. Tryb obraz na wideo przyjmuje 1-2 obrazy jako pierwszą i opcjonalnie ostatnią klatkę; tryb reference-to-video wymaga co najmniej jednego obrazu lub wideo referencyjnego.
Wyjście w rozdzielczości 768p lub 2K o długości 5-15 sekund, tylko pełne sekundy. Rozdzielczość określa stawkę za sekundę. Prompty są ograniczone do 4000 znaków. Wideo i audio referencyjne są ograniczone do 3 plików każde, 2-15 sekund na plik i łącznie 15 sekund.
„MiniMax H3” to ID modelu APIXO. Nie przenoś wartości parametrów, poziomów jakości ani zasad rozliczeń z Hailuo 2.3 lub Hailuo 2.3 Fast — są to osobne ścieżki z innymi warunkami.
Referencje kierują generowaniem, ale nie gwarantują dokładnej tożsamości, typografii, logo, materiałów ani geometrii produktu.
Przed publikacją zweryfikuj anatomię, dłonie, kontakt z obiektami, szybki ruch, okluzję, przejścia kamery, mowę i synchronizację audiowizualną.
Tak. Model jest dostępny na asynchronicznym punkcie końcowym APIXO i można go wywoływać za pomocą tego samego klucza API, co każdy inny model w katalogu. Generowanie jest również dostępne w Playground na tej stronie.
Tekst na wideo, obraz na wideo i reference-to-video. Tryb reference-to-video akceptuje do 9 obrazów, 3 plików wideo i 3 plików audio jako połączony kontekst kreatywny; audio nie może być dodane samodzielnie.
Wyjście w rozdzielczości 768p lub 2K o długości od 5 do 15 sekund, w pełnych sekundach. 2K jest domyślną i najwyższą rozdzielczością udostępnianą przez punkt końcowy; 768p jest rozliczane po niższej stawce za sekundę. Proporcje można ustawić na 21:9, 16:9, 4:3, 1:1, 3:4 lub 9:16 dla trybów tekst na wideo i wideo z referencji; tryb obraz na wideo przejmuje kadrowanie z dostarczonej pierwszej klatki.
Wideo wyjściowe jest rozliczane za sekundę w każdym trybie, według stawki odpowiadającej wybranej rozdzielczości — 768p jest tańsze za sekundę niż 2K. W trybie wideo z referencji, rzeczywiste sekundy Twoich filmów referencyjnych są rozliczane według tej samej stawki za sekundę, a pierwsze 5 obrazów referencyjnych jest darmowe, przy czym każdy dodatkowy obraz jest płatny osobno. Audio referencyjne nie jest rozliczane. Sprawdź aktualne stawki w zakładce cennika.
Tak. Dźwięk jest tworzony w tym samym przebiegu co obraz jako natywne stereo, a mowa, efekty dźwiękowe, tło i muzyka są modelowane wspólnie, a nie jako osobne ścieżki.
Nie. Referencje multimedialne komunikują intencję twórczą, ale nie gwarantują dokładnej tożsamości, ruchu, głosu, struktury produktu ani reprodukcji na poziomie klatki. Użycie produkcyjne wymaga weryfikacji wizualnej i dźwiękowej.
Odkryj więcej modeli AI dla swojego kolejnego kreatywnego przepływu pracy