APIXO
Génération de vidéoEntrée multimodaleAperçu

Gemini Omni Flash est le modèle multimodal de Google en avant-première pour la génération et l'édition de vidéos. APIXO expose la génération de vidéos ainsi que des workflows réutilisables pour les ressources audio et les personnages, avec des références de texte, d'image, de vidéo et de ressources enregistrées. Créez ou transformez des vidéos avec des visuels et un son coordonnés, une logique de scène cohérente et des options de sortie APIXO jusqu'à 4K.

Entrées

Texte / Image / Vidéo / Ressources audio

Prix APIXO

$0.10 / secondLes modifications de vidéo source ont une tarification par opération

Résolution APIXO

720p / 1080p / 4K

Durée

4 / 6 / 8 / 10 secondesSans vidéo source en entrée

Publié le

30 mai 2026

Créer avec Gemini Omni

Chargement de l'espace de travail...

Disponible sur APIXO

Créez des workflows vidéo multimodaux avec Gemini Omni

Créez des vidéos courtes à partir de prompts et de références mixtes, ou transformez une vidéo source via des instructions en langage naturel. APIXO ajoute des modes de ressources audio et de personnages réutilisables autour de sa route vidéo Gemini Omni, permettant aux applications de préparer des voix et des sujets avant de les combiner avec des images, des vidéos et des contrôles de cadrage, de durée et de résolution.

Capacités

Combinez des références créatives pour une sortie vidéo cohérente

Génération à références mixtes

Le mode vidéo d'APIXO accepte des prompts accompagnés d'images, d'une vidéo source, d'ID de personnages réutilisables et d'ID audio. Ces références peuvent guider l'apparence, le mouvement, la structure de la scène et le son au sein d'une seule requête de génération de vidéo.

Transformation de vidéo source

Fournissez une vidéo et décrivez la transformation, comme le changement d'environnement, le traitement visuel, l'action ou les éléments de scène sélectionnés. APIXO expose également des positions de début et de fin pour choisir la portion pertinente de l'entrée.

Ressources de personnages réutilisables

Créez une ressource de personnage à partir d'exactement une image, associée en option à une ressource audio préparée. L'ID de personnage retourné peut ensuite être réutilisé dans des requêtes vidéo, APIXO prenant en charge jusqu'à trois ID de personnage par génération.

Ressources audio réutilisables

Créez une ressource audio à partir d'une voix de base prise en charge par APIXO, d'une description vocale optionnelle et d'un dialogue de prévisualisation. Enregistrez l'ID audio résultant pour des requêtes ultérieures de personnage ou de vidéo ; le mode vidéo accepte jusqu'à trois ID audio.

Logique de scène adaptée au monde

Google positionne Gemini Omni Flash autour de la connaissance du monde et de la compréhension du comportement physique. Cela l'aide à construire des scènes basées sur l'histoire, la science, le contexte culturel, la gravité, le mouvement, les matériaux et d'autres relations du monde réel.

Visuels et son coordonnés

Gemini Omni Flash génère une vidéo avec une piste audio d'accompagnement et peut répondre à des instructions de synchronisation pour les dialogues, la musique, les effets, les coupes et les événements à l'écran. La précision du prompt reste importante lorsqu'une synchronisation exacte ou un timing de texte est requis.

Détails de l'API

Configuration Gemini Omni sur APIXO

Modes d'actifs vérifiés, autorisations de référence, paramètres de sortie et quotas publiés pour la route APIXO.

Ressource audio / Ressource de personnage / Vidéo

Modes

16:9 / 9:16

Formats d'image

Jusqu'à 3 ID

Ressources audio

Jusqu'à 3 ID

Ressources de personnages

Jusqu'à 1 URL

Vidéo source

7 Unités

Quota de références

Utilisations en production

Créez des systèmes de production vidéo basés sur des références

Campagnes de marque

Vidéos de présentateur cohérentes

Préparez un personnage réutilisable à partir d'un portrait approuvé et associez-le à une ressource audio sélectionnée. Les applications peuvent ensuite générer de courtes vidéos de campagne menées par un présentateur à travers différentes scènes tout en réutilisant les mêmes références de personnage et de voix.

Création publicitaire de produit

Récits de produits multimodaux

Combinez des images de produits, des ressources de personnages, des directives audio et un brief de scène écrit pour créer des clips de lancement ou des concepts publicitaires. Utilisez un cadrage paysage ou portrait pour préparer des variations pour les vitrines, les pages de campagne et les canaux mobiles.

Adaptation vidéo

Restylisation de séquences sources

Soumettez un clip existant et demandez un nouvel environnement, un nouveau style visuel, un traitement d'objet ou un effet narratif. Les contrôles de début et de fin permettent aux développeurs de sélectionner le segment source pertinent avant d'appliquer la transformation via APIXO.

Médias de connaissance

Explications visuelles et storyboards

Utilisez la connaissance du monde et le raisonnement physique de Gemini Omni pour développer de courtes vidéos explicatives sur la science, l'histoire, les processus ou les concepts, avec une narration et des mouvements coordonnés. Traitez le contenu factuel comme une ébauche et vérifiez les détails importants avant publication.

Flux de travail des ressources

Préparez les entrées réutilisables avant de générer la vidéo

APIXO sépare la préparation optionnelle de l'audio et du personnage de la génération vidéo asynchrone de Gemini Omni.

Créer une ressource audio

Sélectionnez une voix de base prise en charge par APIXO, nommez la ressource et fournissez éventuellement une direction vocale et un dialogue de prévisualisation. Enregistrez l'ID audio retourné pour une utilisation ultérieure avec un personnage ou directement dans une requête vidéo.

Préparer une ressource de personnage

Soumettez exactement une image de personnage publique avec un prompt descriptif et, si utile, un ID audio sauvegardé. Stockez l'ID de personnage résultant pour pouvoir le référencer dans de futures tâches vidéo Gemini Omni.

Générer la vidéo finale

Combinez le prompt avec des images éligibles, des ID audio, des ID de personnage ou une vidéo source. Choisissez une résolution et une option de cadrage prises en charge par APIXO, puis récupérez la vidéo terminée par interrogation asynchrone ou via un webhook.

Notes & FAQ

Disponibilité et contraintes de Gemini Omni

Notes opérationnelles

01

Cette page couvre les modes actuels de génération vidéo, d'assets audio et de personnages de Gemini Omni sur APIXO. Elle ne concerne pas les API de chat, de génération d'images, d'analyse de documents ou de synthèse/reconnaissance vocale autonomes de Gemini.

02

Le Playground du navigateur d'APIXO est fixé en mode vidéo ; la préparation des ressources audio et de personnage est documentée pour une utilisation via l'API.

03

APIXO ne documente pas l'importation directe de fichiers audio pour cette route ; les requêtes vidéo utilisent des ID audio créés via son mode de ressource audio.

04

Le quota combiné d'images, de vidéos sources et de personnages est de sept unités ; une vidéo consomme deux unités, tandis que chaque image ou personnage en consomme une.

05

APIXO n'expose pas le flux de travail stateful previous_interaction_id de Gemini, les sessions en temps réel, l'analyse de documents ou l'utilisation d'outils sur ce point de terminaison.

06

L'anglais est entièrement pris en charge en amont ; les autres langues n'ont pas été évaluées et peuvent produire des résultats moins prévisibles.

Foire Aux Questions

Non. Cette page APIXO couvre le flux de travail vidéo de Gemini Omni de Google, et non les modèles Gemini pour le chat, le codage, l'analyse de documents ou les agents. Ses sorties publiées sont des ID de ressource audio ou de personnage réutilisables et des URL de vidéo générée, selon le mode APIXO sélectionné.

APIXO expose trois modes : la création de ressources audio, la création de ressources de personnage et la génération de vidéo asynchrone. Les modes de ressources préparent des ID réutilisables pour les requêtes vidéo ; ils ne sont pas des points de terminaison autonomes pour la musique, la transcription vocale, la génération d'images ou les réponses conversationnelles.

Sans vidéo source, le 720p et le 1080p coûtent $0.10 par seconde générée, tandis que le 4K coûte $0.20 par seconde. Avec une vidéo source, APIXO facture $1.20 par requête en 720p ou 1080p et $1.80 en 4K.

Les vidéos générées par prompt et par référence sans vidéo source supportent des durées de 4, 6, 8 ou 10 secondes. Lorsqu'une URL de vidéo source est fournie, APIXO ignore le paramètre de durée et utilise à la place le segment d'entrée sélectionné avec une facturation fixe par requête.

APIXO documente la transformation basée sur un prompt d'une vidéo source importée, mais ne publie pas le paramètre d'interaction multi-tours avec état de Google sur ce point de terminaison. Traitez chaque tâche APIXO comme une requête indépendante, à moins que le schéma en direct ne documente ultérieurement un état conversationnel.

Explorer d'autres modèles

Découvrez d'autres modèles d'IA pour votre prochain workflow créatif