Nie. Ta strona APIXO opisuje przepływ pracy z wideo Google Gemini Omni, a nie modele Gemini do czatu, kodowania, analizy dokumentów czy agentów. Udostępniane wyniki to identyfikatory zasobów audio lub postaci wielokrotnego użytku oraz wygenerowane adresy URL wideo, w zależności od wybranego trybu APIXO.
Gemini Omni Flash to przedpremierowy multimodalny model Google do generowania i edycji wideo. APIXO udostępnia generowanie wideo wraz z przepływami pracy dla zasobów audio i postaci wielokrotnego użytku, z referencjami tekstowymi, obrazowymi, wideo i zapisanymi zasobami. Twórz lub transformuj filmy ze spójną oprawą wizualną i dźwiękiem, logiką scen uwzględniającą kontekst i opcjami wyjściowymi APIXO do 4K.
Wejścia
Tekst / Obraz / Wideo / Zasoby audio
Cena APIXO
$0.10 / secondEdycje wideo źródłowego wyceniane są za operację
Rozdzielczość APIXO
720p / 1080p / 4K
Czas trwania
4 / 6 / 8 / 10 SekundBez źródłowego pliku wideo
Wydany
30 maja 2026
Twórz z Gemini Omni
Ładowanie przestrzeni roboczej...
Łącz kreatywne referencje w spójne wideo
Generowanie z wielu referencji
Tryb wideo APIXO akceptuje prompty wraz z obrazami, jednym źródłowym wideo, identyfikatorami postaci wielokrotnego użytku oraz identyfikatorami audio. Te odniesienia mogą sterować wyglądem, ruchem, strukturą sceny i dźwiękiem w ramach jednego żądania generowania wideo.
Transformacja wideo źródłowego
Dostarcz jedno wideo i opisz transformację, taką jak zmiana otoczenia, stylu wizualnego, akcji lub wybranych elementów sceny. APIXO udostępnia również pozycje początkowe i końcowe do wyboru odpowiedniej części materiału wejściowego.
Zasoby postaci wielokrotnego użytku
Stwórz zasób postaci z dokładnie jednego obrazu, opcjonalnie powiązanego z jednym przygotowanym zasobem audio. Zwrócony identyfikator postaci może być następnie ponownie użyty w żądaniach wideo, przy czym APIXO obsługuje do trzech identyfikatorów postaci na generację.
Zasoby audio wielokrotnego użytku
Zbuduj zasób audio z bazowego głosu wspieranego przez APIXO, opcjonalnego opisu głosu i dialogu podglądowego. Zapisz wynikowy identyfikator audio do późniejszych żądań dotyczących postaci lub wideo; tryb wideo akceptuje do trzech identyfikatorów audio.
Logika sceny zorientowana na świat
Google pozycjonuje Gemini Omni Flash wokół wiedzy o świecie i rozumienia fizycznych zachowań. Pomaga to w konstruowaniu scen opartych na historii, nauce, kontekście kulturowym, grawitacji, ruchu, materiałach i innych relacjach ze świata rzeczywistego.
Skoordynowana warstwa wizualna i dźwiękowa
Gemini Omni Flash generuje wideo z towarzyszącą ścieżką dźwiękową i może reagować na instrukcje czasowe dotyczące dialogów, muzyki, efektów, cięć i zdarzeń na ekranie. Precyzja promptu pozostaje ważna, gdy wymagana jest dokładna synchronizacja lub timing tekstu.
Konfiguracja Gemini Omni w APIXO
Zweryfikowane tryby zasobów, dozwolone referencje, ustawienia wyjściowe i limity opublikowane dla ścieżki APIXO.
Zasób audio / Zasób postaci / Wideo
Tryby
16:9 / 9:16
Proporcje
Do 3 identyfikatorów
Zasoby audio
Do 3 identyfikatorów
Zasoby postaci
Do 1 adresu URL
Wideo źródłowe
7 jednostek
Limit referencji
Buduj systemy produkcji wideo oparte na referencjach
Spójne wideo z prezenterem
Przygotuj postać wielokrotnego użytku na podstawie zatwierdzonego portretu i połącz ją z wybranym zasobem audio. Aplikacje mogą następnie generować krótkie filmy kampanii prowadzone przez prezentera w różnych scenach, ponownie wykorzystując te same odniesienia do postaci i głosu.
Multimodalne historie produktowe
Połącz zdjęcia produktów, zasoby postaci, wytyczne audio i pisemny opis sceny, aby tworzyć klipy premierowe lub koncepcje reklamowe. Użyj kadrów poziomych lub pionowych, aby przygotować warianty dla witryn sklepowych, stron kampanii i kanałów mobilnych.
Zmiana stylu materiału źródłowego
Prześlij istniejący klip i zażądaj nowego otoczenia, stylu wizualnego, potraktowania obiektu lub efektu narracyjnego. Kontrolki początku i końca pozwalają deweloperom wybrać odpowiedni segment źródłowy przed zastosowaniem transformacji przez APIXO.
Wizualne objaśnienia i storyboardy
Wykorzystaj wiedzę o świecie i zdolność rozumowania fizycznego Gemini Omni do tworzenia krótkich materiałów wyjaśniających zjawiska naukowe, historyczne, procesy lub koncepcje, ze skoordynowaną narracją i ruchem. Traktuj treści faktograficzne jako wersje robocze i zweryfikuj ważne szczegóły przed publikacją.
Przygotuj dane wejściowe wielokrotnego użytku przed generowaniem wideo
APIXO oddziela opcjonalne przygotowanie zasobów audio i postaci od asynchronicznego generowania wideo Gemini Omni.
Utwórz zasób audio
Wybierz obsługiwany przez APIXO głos bazowy, nazwij zasób i opcjonalnie podaj wskazówki dotyczące głosu oraz dialog do podglądu. Zapisz zwrócone ID audio do późniejszego użycia z postacią lub bezpośrednio w żądaniu wideo.
Przygotuj zasób postaci
Prześlij dokładnie jeden publiczny obraz postaci z opisowym promptem i, jeśli to przydatne, jedno zapisane ID audio. Zapisz wynikowe ID postaci, aby można było się do niego odwoływać w przyszłych zadaniach wideo Gemini Omni.
Generuj finalne wideo
Połącz prompt z odpowiednimi obrazami, ID audio, ID postaci lub jednym źródłowym wideo. Wybierz obsługiwaną przez APIXO rozdzielczość i opcję kadrowania, a następnie pobierz ukończone wideo poprzez asynchroniczne odpytywanie lub dostarczenie przez webhook.
Dostępność i ograniczenia Gemini Omni
Uwagi operacyjne
Ta strona opisuje bieżące tryby wideo, zasobów audio i zasobów postaci Gemini Omni dostępne w APIXO. Nie dotyczy to Gemini w trybie czatu, generowania obrazów, analizy dokumentów ani samodzielnych API mowy.
Przeglądarkowy Playground APIXO jest ustawiony na tryb wideo; przygotowanie zasobów audio i postaci jest udokumentowane do użytku przez API.
APIXO nie dokumentuje bezpośredniego przesyłania plików audio dla tej ścieżki; żądania wideo używają ID audio utworzonych w trybie zasobów audio.
Łączny limit obrazów, wideo źródłowych i postaci wynosi siedem jednostek; jedno wideo zużywa dwie jednostki, podczas gdy każdy obraz lub postać zużywa jedną.
APIXO nie udostępnia na tym punkcie końcowym przepływu pracy Gemini opartego na stanie z `previous_interaction_id`, sesji w czasie rzeczywistym, analizy dokumentów ani użycia narzędzi.
Język angielski jest w pełni obsługiwany przez dostawcę; inne języki nie zostały ocenione i mogą dawać mniej przewidywalne wyniki.
Często zadawane pytania
APIXO udostępnia trzy tryby: tworzenie zasobów audio, tworzenie zasobów postaci oraz asynchroniczne generowanie wideo. Tryby zasobów przygotowują identyfikatory wielokrotnego użytku dla żądań wideo; nie są to samodzielne punkty końcowe do generowania muzyki, transkrypcji mowy, generowania obrazów ani odpowiedzi konwersacyjnych.
Bez źródłowego pliku wideo, generowanie wideo w rozdzielczości 720p i 1080p kosztuje $0.10 za sekundę, a w 4K $0.20 za sekundę. Z jednym źródłowym plikiem wideo, APIXO pobiera opłatę $1.20 za żądanie w rozdzielczości 720p lub 1080p oraz $1.80 w 4K.
Wideo generowane na podstawie promptu i obrazu referencyjnego bez wideo źródłowego obsługują długość 4, 6, 8 lub 10 sekund. Po podaniu adresu URL wideo źródłowego, APIXO ignoruje ustawienie czasu trwania i zamiast tego używa wybranego segmentu wejściowego oraz stałej opłaty za żądanie.
APIXO dokumentuje transformację jednego przesłanego źródłowego wideo na podstawie promptu, ale nie udostępnia stanowego parametru interakcji wieloturowej od Google w tym punkcie końcowym. Każde zadanie APIXO należy traktować jako niezależne żądanie, chyba że schemat na żywo udokumentuje w przyszłości stan konwersacji.
Odkryj inne modele
Odkryj więcej modeli AI dla swojego kolejnego kreatywnego przepływu pracy