Tak. APIXO oznacza i wycenia tę ścieżkę jako Kling 3.0 Standard. Jest ona oddzielna od Kling 3.0 Turbo i Video 3.0 Omni, więc ich szybkość, funkcje referencyjne, kontrolki edycji i cennik nie mają tutaj zastosowania.
Kling Video 3.0 Standard od Kuaishou na platformie APIXO łączy generowanie wideo z tekstu, animację obrazu i transfer ruchu postaci. Wydłuża generowane klipy do 15 sekund, obsługuje opcjonalny dźwięk natywny i dodaje prompty na poziomie ujęć dla lepszej kontroli narracji, podczas gdy kontrola ruchu łączy jeden obraz postaci z jednym referencyjnym wideo.
Tryby APIXO
Generuj / Animuj / Przenieś
Cena bez dźwięku
$0.084/sTryby tekstowe i obrazkowe bez generowanego dźwięku
Cena za wygenerowany dźwięk
$0.13/sTryby tekstowe i obrazkowe z generowanym dźwiękiem
Długość generacji
3–15 sekund
Wydany
5 lut 2026
Twórz z Kling 3.0 Std
Ładowanie przestrzeni roboczej...
Większa kontrola nad narracją i ciągłością
Wydłużony czas trwania sceny
Kling Video 3.0 wydłuża natywne generowanie do 15 sekund, dając więcej przestrzeni na akcje, dialogi, zmiany kamery i rozwój sceny niż dziesięciosekundowe maksimum w Kling Video 2.6.
Wieloujęciowe opowiadanie historii
Kuaishou zaprojektowało Video 3.0 do interpretacji instrukcji wieloscenowych i wieloujęciowych, w tym zmian kątów kamery, dialogów typu ujęcie-przeciwujęcie, montażu równoległego i narracji z offu. APIXO udostępnia opcjonalne, czasowe segmenty promptów dla generowania z tekstu i obrazu.
Większa spójność elementów
Zwiększona spójność pomaga zachować bardziej jednolity wygląd postaci, obiektów, otoczenia i elementów marki w kolejnych klatkach. Złożone ruchy i dłuższe sekwencje mogą nadal wprowadzać wizualne niezgodności i wymagać weryfikacji.
Natywny Dźwięk Wielojęzyczny
Upstream Video 3.0 obsługuje generowaną mowę w języku angielskim, chińskim, japońskim, koreańskim i hiszpańskim, a także angielskie akcenty i chińskie dialekty. APIXO udostępnia generowany dźwięk poprzez kontrolkę dźwięku dla trybów opartych na tekście i obrazie.
Lepsze zachowanie tekstu
Kuaishou informuje o poprawie zachowania i generowania widocznego tekstu, takiego jak szyldy, napisy, logotypy i ubrania z napisami. Dokładna pisownia i umiejscowienie powinny być nadal sprawdzane przed użyciem komercyjnym.
Fotorealistyczne Wykonanie
Video 3.0 poprawia fotorealistyczne wyniki dla wyrazistych postaci i dynamicznych scen. Szczegółowe prompty mogą koordynować zachowanie obiektu, kierunek kamery, rozwój sceny i dźwięk w ramach jednej wygenerowanej sekwencji.
Wygeneruj nową scenę lub przenieś istniejący ruch
Generowanie tekstu i obrazu
Stwórz z promptu lub animuj jeden do dwóch obrazów na 3–15 sekund. Wybierz generowany dźwięk lub wyjście bez dźwięku i opcjonalnie podziel klip na segmenty z określonym czasem dla promptów, aby kierować na poziomie ujęć.
Kontrola ruchu postaci
Połącz dokładnie jeden obraz postaci z jednym referencyjnym wideo ruchowym. Wybierz, czy orientacja ma podążać za obrazem czy wideo; czas trwania pochodzi z klipu referencyjnego, a ustawienie dźwięku określa, czy jego oryginalne audio zostanie zachowane.
Kling 3.0 Standard na APIXO
Kontrolki specyficzne dla przepływu pracy przy generowaniu i transferze ruchu.
1:1 / 9:16 / 16:9
Proporcje tekstu na wideo
1–2 obrazy
Obraz na wideo
1 obraz + 1 wideo
Kontrola ruchu
Do 30 sekund
Referencja Ruchu
JPG / JPEG / PNG
Formaty obrazów
1 adres URL pliku MP4
Wynik z APIXO
Twórz historie, występy i markowe materiały wideo
Prototypy Scen Wieloujęciowych
Zbuduj dłuższy wygenerowany klip za pomocą segmentów promptów z określonym czasem, aby stworzyć ujęcia wprowadzające, zbliżenia, reakcje i przejścia. Użyj wyniku do przetestowania rytmu narracji, zmian kamery, płynności dialogów i logiki sceny przed rozpoczęciem produkcji.
Transfer Ruchu z Referencji
Zastosuj ruch z krótkiego wideo referencyjnego do obrazu postaci na potrzeby studiów performatywnych, testów choreografii lub stylizowanej animacji. Wybierz orientację w zależności od tego, czy kierunek ciała ma podążać za obrazem źródłowym, czy za materiałem ruchowym.
Markowe kampanie audiowizualne
Twórz prezentacje produktów, reklamy z narracją i krótkie kampanie społecznościowe z opcjonalną natywną mową, muzyką, tłem dźwiękowym i efektami. Przed publikacją zweryfikuj geometrię produktu, widoczny tekst, logotypy, treść wypowiedzi i synchronizację.
Koncepcje Konwersacji Wielojęzycznych
Twórz prototypy rozmów, wywiadów i scen wielojęzycznych, korzystając z natywnych funkcji głosowych Kling Video 3.0. Jasno określ każdego mówcę, język, kolejność, ton i akcję, a następnie zweryfikuj przypisanie głosu, wymowę, ruch ust i ciągłość.
Zastosuj poprawne zasady dotyczące dźwięku i czasu trwania
Ograniczenia APIXO
Generowanie tekstu na wideo i obrazu na wideo akceptuje czas trwania od 3 do 15 sekund; sterowanie ruchem ignoruje to pole.
Funkcja obraz na wideo akceptuje jeden obraz początkowy i opcjonalnie drugi obraz, który może wpływać na klatkę końcową.
Kontrola ruchu wymaga dokładnie jednego obrazu postaci i jednego publicznego wideo referencyjnego o długości nieprzekraczającej 30 sekund.
Wybór proporcji dotyczy tylko generowania z tekstu na wideo przez APIXO.
APIXO nie udostępnia tutaj oddzielnego trybu przesyłania audio, rozszerzania wideo, edycji wideo ani dowolnego trybu z wieloma referencjami.
Integracje produkcyjne mogą pobierać wyniki asynchronicznie poprzez odpytywanie (polling) lub publiczny webhook HTTPS.
Pytania dotyczące Kling 3.0 Standard
Generowanie wideo z tekstu (text-to-video) i obrazu (image-to-video) kosztuje $0.084 za wygenerowaną sekundę z wyłączonym dźwiękiem lub $0.13 za sekundę z włączonym dźwiękiem. Czas trwania podlegający opłacie to wybrana wartość od 3 do 15 sekund.
APIXO nalicza opłaty za motion-control w wysokości $0.13 za każdą wykrytą sekundę wideo referencyjnego, z minimum trzech sekund podlegających opłacie. Przesłane pole czasu trwania jest ignorowane, a wideo referencyjne dłuższe niż 30 sekund są odrzucane.
Dla generowania tekst na wideo i obraz na wideo, sound: true żąda wygenerowania dźwięku przez model, a false tworzy wideo bez dźwięku. W przypadku kontroli ruchu to samo pole określa, czy oryginalny dźwięk z wideo referencyjnego ma być zachowany, zamiast żądania nowo wygenerowanego dźwięku.
Sprawdź tożsamość, anatomię, dłonie, kontakt z obiektami, osadzony tekst, logikę przejść, szybki ruch, przypisanie mówcy, dokładność dialogów, wymowę i synchronizację ruchu warg. Dłuższe sceny lub sceny z wieloma ujęciami stwarzają więcej możliwości dla dryfu czasowego i postaci.
Odkryj inne modele
Odkryj więcej modeli AI dla swojego kolejnego kreatywnego przepływu pracy