Wan 2.6 Video to punkt końcowy APIXO obsługujący pięć przepływów pracy generowania wideo od Alibaba. Twórz klipy audiowizualne z tekstu, animuj pojedynczy obraz źródłowy lub kieruj postaciami za pomocą uporządkowanych obrazów i wideo referencyjnych. Tryby Standard i Flash oferują rozdzielczość 720p lub 1080p, kontrolę nad wieloma ujęciami, niestandardowy dźwięk oraz czas trwania i ceny specyficzne dla trybu.
Przepływy pracy
Tekst / Obraz / Referencje
Cena APIXO
$0.025–$0.30 / sTrasy Standard i Flash wyceniane po stronie backendu
Rozdzielczość
720p / 1080p
Czas trwania
2–15 s · Odniesienia ≤10 s
Limit referencji
Do 5 plików
Twórz z Wan 2.6
Ładowanie przestrzeni roboczej...
Operacyjna trasa API
Jeden punkt końcowy Wan 2.6 do obsługi promptów, klatek i postaci referencyjnych.
Zintegruj generowanie wideo z tekstu, animację obrazu w trybie Standard lub Flash oraz generowanie referencyjne w trybie Standard lub Flash za pomocą jednej trasy APIXO. Każdy tryb wymaga promptu, a uporządkowane dane wejściowe multimediów, wybór wielu ujęć, niestandardowe audio i kontrola dźwięku (tylko w trybie Flash) wspierają różne strategie produkcyjne.
Możliwości modelu
Kontroluj, jak każda scena Wan 2.6 się zaczyna i rozwija
Generowanie na podstawie tekstu
Utwórz wideo bez obrazu źródłowego na podstawie wymaganego promptu w języku chińskim lub angielskim, opisującego postacie, akcję, otoczenie, zachowanie kamery, dialogi i dźwięk.
Animacja od pierwszej klatki
Tryby obrazu Standard i Flash animują dokładnie jeden obraz źródłowy. Prompt pozostaje wymagany i kieruje ruchem, zachowaniem kamery oraz rozwojem sceny od początkowego stanu wizualnego.
Uporządkowane referencje medialne
Tryby referencyjne akceptują uporządkowane adresy URL obrazów i wideo, które mapują się do ról character1, character2 i kolejnych w celu uzyskania wskazówek dotyczących wyglądu, ruchu, sceny lub dostępnego głosu.
Struktura wieloujęciowa
Wybierz „single” dla jednego ciągłego ujęcia lub „multi” dla sekwencji zmieniających się ujęć. To ustawienie ma priorytet nad sprzecznymi instrukcjami dotyczącymi ujęć w prompcie.
Wskazówki audiowizualne
Prześlij jeden opcjonalny plik MP3 lub WAV w celu niestandardowej synchronizacji lub pozwól, aby generowanie z obsługą dźwięku stworzyło wyjście audiowizualne bez gwarancji dokładnego dialogu, wymowy czy synchronizacji ruchu warg.
Kontrola promptu i seed
Dopracuj wynik za pomocą negatywnego promptu, rozszerzenia promptu i numerycznego seed. Stałe wartości seed pomagają w kontrolowanej iteracji, ale nie mogą uczynić probabilistycznego generowania deterministycznym.
Profile trasowania
Wybierz standardowe przepływy pracy lub generowanie Flash z konfigurowalnym dźwiękiem.
Standardowe przepływy pracy wideo
Standardowy routing obejmuje generowanie tekstu na wideo, obrazu na wideo oraz wideo na podstawie referencji. Generowanie z tekstu i obrazu obsługuje długość 2–15 sekund, podczas gdy generowanie na podstawie referencji obsługuje 2–10 sekund. Pole dźwięku nie jest dostępne w tych trybach.
Standardowy
Przepływy pracy Flash Video
Routing flash jest dostępny tylko dla zadań obraz na wideo-flash i referencja na wideo-flash. Domyślnie kontrola dźwięku jest włączona (true); wyłączenie jej powoduje generowanie wideo bez dźwięku, ignoruje dostarczony dźwięk i stosuje niższą stawkę Flash.
Flash
Specyfikacje API
Zweryfikowane opcje dla ścieżki operacyjnej
Dane wejściowe i limity specyficzne dla trybu, dostępne przez APIXO.
5
Tryby generowania
1–1500
Znaki w prompcie
1 obraz
Dane wejściowe trybu obrazu
1–5 plików
Wejście referencyjne
1 MP3 / WAV
Niestandardowe audio
Polling / Callback
Dostarczanie wyników
Zastosowania produkcyjne
Dopasuj każdą strategię wejściową do praktycznego przepływu pracy wideo.
Rozwój koncepcji
Wizualizuj sekwencje kampanii
Użyj trybu tekst na wideo i kontroli wieloujęciowej, aby eksplorować krótkie narracje kampanii, zmiany kamery i rozwój sceny przed rozpoczęciem filmowania lub szczegółową postprodukcją. Sprawdź anatomię, kontakt obiektów, logotypy i osadzony tekst.
Animacja zasobów
Animowanie kluczowych grafik produktowych
Przekształć zatwierdzony obraz produktu, ilustrację lub wizualizację kampanii w ruch, korzystając z routingu Standard lub Flash. Porównaj wynik z materiałem źródłowym pod kątem geometrii, proporcji, kompozycji i wierności marce.
Kierowanie postacią
Inscenizuj interakcje oparte na referencjach
Przypisz uporządkowane materiały referencyjne (obrazy lub wideo) do ról postaci na potrzeby krótkich rozmów i scen z wieloma postaciami. Weryfikuj tożsamość, pozycjonowanie, dryf głosu, przypisanie dialogów, wymowę i ruchy ust w każdym wyniku.
Proces twórczy oparty na audio
Twórz niestandardowe promocje audio
Dostarcz narrację, muzykę lub udźwiękowienie, aby ukierunkować krótki klip promocyjny. Sprawdź timing i synchronizację przed publikacją lub wyłącz dźwięk Flash, gdy wymagany jest tylko niskokosztowy szkic wizualny.
Wskazówki dotyczące integracji
Ograniczenia trybu, zasady dotyczące mediów i rozliczenia
Uwagi operacyjne
01
APIXO udostępnia pięć trybów produktowych, ale nie identyfikuje publicznie precyzyjnego checkpointu lub snapshotu używanego dla każdej trasy.
02
Każdy tryb wymaga niepustego promptu o długości do 1500 znaków; opcjonalny negatywny prompt obsługuje do 500 znaków.
03
Tryby obrazu wymagają jednego publicznego adresu URL pliku JPEG, JPG, PNG bez kanału alfa, BMP lub WebP, o rozmiarze do 20 MB i wymiarach od 240 do 8000 pikseli.
04
Tryby referencyjne akceptują od jednego do pięciu uporządkowanych plików: do pięciu obrazów, do trzech filmów MP4 lub MOV, i łącznie nie więcej niż pięć plików.
05
Niestandardowe audio akceptuje jeden publiczny adres URL pliku MP3 lub WAV, o długości 3–30 sekund i rozmiarze do 15 MB; nadmiarowy dźwięk jest przycinany, a krótki plik wejściowy pozostawia resztę czasu w ciszy.
06
APIXO nie publikuje okresu przechowywania adresu URL z wynikami dla tej trasy. Odpytuj tryby tekstowe lub obrazowe po 30 sekundach, a tryby referencyjne po 45 sekundach, lub użyj dostarczania przez callback, aby uzyskać ostateczne wyniki; przechowuj wymagane dane wyjściowe niezwłocznie po zakończeniu.
Często zadawane pytania
Generowanie wideo z tekstu (text-to-video) i z obrazu (image-to-video) kosztuje $0.10 za sekundę w rozdzielczości 720p lub $0.15 w 1080p. Generowanie wideo na podstawie referencji (reference-to-video) kosztuje $0.20 za sekundę w 720p lub $0.30 w 1080p. Całkowity koszt to wybrany czas trwania pomnożony przez odpowiednią stawkę.
Image Flash kosztuje 0,025 $/0,0375 $ za sekundę w rozdzielczości 720p/1080p bez dźwięku i 0,05 $/0,075 $ z dźwiękiem. Reference Flash kosztuje 0,05 $/0,08 $ bez dźwięku i 0,10 $/0,16 $ z dźwiękiem.
Tylko image-to-video-flash i reference-to-video-flash akceptują dźwięk. Domyślnie ustawione na true. Gdy ustawione na false, wygenerowane wideo jest nieme, a jakakolwiek podana wartość audio_urls jest ignorowana.
Ustaw shot_type na multi i pozostaw włączone prompt_extend, aby Wan 2.6 mógł przepisać i zoptymalizować opis ujęcia. Użyj single, gdy scena ma pozostać jednym ciągłym ujęciem.
Zadania używają statusów oczekujący, w trakcie przetwarzania, zakończony powodzeniem i niepowodzeniem. Adresy URL pomyślnie wygenerowanych wideo pojawiają się w resultJson.resultUrls; błędy ujawniają failCode i failMsg. Dostarczenie przez wywołanie zwrotne (callback) wymaga osiągalnego, publicznego punktu końcowego wywołania zwrotnego.
Odkryj inne modele
Odkryj więcej modeli AI dla swojego kolejnego kreatywnego przepływu pracy