APIXO
视频生成多模态输入预览

Gemini Omni Flash 是 Google 用于视频生成和编辑的预览版多模态模型。APIXO 提供了视频生成功能,以及可复用的音频资产和角色资产工作流,支持文本、图像、视频和已保存的资产作为参考。通过协调的视觉和声音、具备真实世界感知的场景逻辑以及 APIXO 高达 4K 的输出选项,创建或转换视频。

输入

文本 / 图像 / 视频 / 音频资产

APIXO 价格

$0.10 / second源视频编辑按单次操作计费

APIXO 分辨率

720p / 1080p / 4K

时长

4 / 6 / 8 / 10 秒无源视频输入

发布于

2026年5月30日

使用 Gemini Omni 创作

正在加载工作区...

已上线 APIXO

使用 Gemini Omni 构建多模态视频工作流

通过提示词和混合参考素材创建短视频,或通过自然语言指令转换源视频。APIXO 在其 Gemini Omni 视频路由周围添加了可复用的音频和角色资产模式,让应用程序可以在将它们与图像、视频、构图、时长和分辨率控制相结合之前,预先准备好声音和主体。

能力

将多种创意参考素材融合成连贯的视频输出

混合参考素材生成

APIXO 的视频模式支持在生成请求中同时使用提示词、图像、单个源视频、可复用的角色 ID 和音频 ID。这些参考素材可以在单次视频生成请求中,指导视频的外观、动作、场景结构和声音。

源视频转换

提供一个视频并描述转换要求,例如改变环境、视觉处理、动作或指定的场景元素。APIXO 还开放了开始和结束位置参数,以便选择输入视频的相关部分。

可复用的角色素材

使用一张图像创建一个角色素材,并可选择性地关联一个已准备好的音频素材。返回的角色 ID 可在视频请求中复用,APIXO 支持每次生成最多使用三个角色 ID。

可复用的音频素材

基于 APIXO 支持的基础声音、可选的声音描述和预览对话来构建音频素材。保存生成的音频 ID,以供后续创建角色或视频时使用;视频模式最多支持三个音频 ID。

感知世界的场景逻辑

Google 将 Gemini Omni Flash 定位于其强大的世界知识和对物理行为的理解能力。这有助于它构建基于历史、科学、文化背景、重力、运动、材质及其他现实世界关系的场景。

视听协调

Gemini Omni Flash 在生成视频时会附带音轨,并能响应对话、音乐、音效、剪辑和屏幕事件的时间指令。当需要精确同步或文本计时时,提示词的精确性至关重要。

API 详情

APIXO 上的 Gemini Omni 配置

APIXO 路由已发布的经验证的资产模式、参考配额、输出设置和总配额。

音频素材 / 角色素材 / 视频

模式

16:9 / 9:16

宽高比

最多 3 个 ID

音频素材

最多 3 个 ID

角色素材

最多 1 个 URL

源视频

7 个单位

参考素材配额

生产应用

构建由参考素材驱动的视频生产系统

品牌营销活动

形象一致的主讲人视频

使用一张经批准的肖像照准备一个可复用角色,并与选定的音频素材配对。然后,应用程序便可以跨不同场景生成由主讲人引导的营销短视频,同时复用相同的角色和声音参考。

产品创意

多模态产品故事

结合产品图片、角色素材、音频指导和场景书面简介,创作发布短片或广告概念。使用横向或纵向画幅,为店铺、活动页面和移动端渠道准备不同版本的视频。

视频改编

源素材风格重塑

提交一个现有视频片段,并请求新的环境、视觉风格、物体处理或叙事效果。开发者可以通过 APIXO 的开始和结束控制选项,在应用转换前选择相关的源视频片段。

知识媒体

可视化解释器和故事板

利用 Gemini Omni 的世界知识和物理推理能力,开发带有协调旁白和动态效果的科学、历史、流程或概念解说短视频。请将生成的事实性内容视为草稿,并在发布前核实重要细节。

资产工作流

在生成视频前准备可复用输入

APIXO 将可选的音频和角色准备步骤与异步的 Gemini Omni 视频生成分离开来。

创建音频资产

选择一个 APIXO 支持的基础语音,为资产命名,并可选地提供语音指导和预览对话。保存返回的音频 ID,以便后续与角色结合使用或直接在视频请求中使用。

准备角色资产

请准确提交一张公开的角色图片和一段描述性提示词,如有需要,可附上一个已保存的音频 ID。请存储生成的角色 ID,以便在未来的 Gemini Omni 视频任务中引用。

生成最终视频

将提示词与符合条件的图片、音频 ID、角色 ID 或一个源视频结合。选择一个 APIXO 支持的分辨率和画面选项,然后通过异步轮询或 webhook 推送来获取已完成的视频。

说明与常见问题

Gemini Omni 可用性与限制

操作说明

01

本页面介绍了 APIXO 当前的 Gemini Omni 视频、音频资产和角色资产模式。不涉及 Gemini 聊天、图像生成、文档分析或独立的语音 API。

02

APIXO 的浏览器 Playground 固定为视频模式;音频和角色资产的准备功能已在 API 文档中说明。

03

APIXO 未提供此路由的直接音频文件上传功能;视频请求使用的是通过其音频资产模式创建的音频 ID。

04

图片、源视频和角色的组合配额为 7 个单位;一个视频消耗 2 个单位,每张图片或每个角色消耗 1 个单位。

05

APIXO 在此接口地址上不提供 Gemini 的 stateful previous_interaction_id 工作流程、实时会话、文档分析或工具使用功能。

06

上游模型完全支持英语;其他语言未经评估,可能会产生不可预测的结果。

常见问题解答

不是。此 APIXO 页面介绍的是 Google 的 Gemini Omni 视频工作流,而非 Gemini 的聊天、编码、文档分析或智能体模型。根据所选的 APIXO 模式,其输出是可复用的音频或角色资产 ID,以及生成的视频 URL。

APIXO 提供三种模式:音频资产创建、角色资产创建和异步视频生成。资产模式用于为视频请求准备可复用的 ID;它们并非独立的音乐、语音转文字、文生图或对话式响应接口地址。

在没有输入源视频的情况下,720p 和 1080p 的生成费用为每秒 $0.10,4K 为每秒 $0.20。如果提供一个源视频,APIXO 对 720p 或 1080p 的请求收费 $1.20,4K 请求收费 $1.80。

对于通过提示词和参考图生成且无源视频的场景,支持 4、6、8 或 10 秒的时长。如果提供了源视频 URL,APIXO 将忽略时长设置,转而使用所选的输入片段并按单次请求固定计费。

APIXO 支持基于提示词对上传的单个源视频进行转换,但并未在此接口地址上公开 Google 的有状态多轮交互参数。请将每个 APIXO 任务视为独立请求,除非后续的实时 schema 文档中支持了会话状态。

探索其他模型

探索更多 AI 模型,赋能您的创意工作流