是的。该模型已在 APIXO 异步任务接口地址上线,您可以使用与其他所有模型相同的 API 密钥进行调用。您也可以在本页的 Playground 中进行生成。
MiniMax H3 是一款通用多模态视频模型,在单一生成工作流中结合了文本、图像、视频和音频上下文。它能生成分辨率高达2K、时长15秒并带有原生立体声的视频,同时支持首尾帧控制、混合媒体参考、动作迁移、多镜头叙事以及指令引导的视频编辑。
输入
文本 / 图像 / 视频 / 音频
APIXO 价格
$0.09–$0.13 / 秒
分辨率
768P / 2K
时长
5-15 秒
音频
原生立体声
正在加载工作区...
在单个请求中结合书面指导以及图像、视频和音频参考。为每个参考源分配一个角色,如外观、动作、镜头、声音、节奏、环境或风格。
定义起始帧、结束帧或两者,以指导变换、过渡、产品展示和故事板节奏,同时保持更清晰的视觉轨迹。
结合使用参考图、视频和音频,以传达角色身份、产品特征、运动、镜头语言、人声表演、音乐或氛围。
将语音、音效、环境音和音乐与视频一同生成为原生立体声音频,而无需在生成后单独合成音轨。
通过单个提示词引导或参考图指导的工作流,构建包含协调镜头切换、场景推进、动作连续性和视听节奏的短片序列。
通过自然语言指导转换现有视觉素材,或从视频参考中迁移运动,同时检查角色一致性、构图、遮挡和源细节的保真度。
结合产品图像、书面指导、动态参考和声音意图来构思营销活动概念。在批准生成的商业资产前,请审查标签、标志、材质、尺寸和产品几何形状。
使用视觉参考素材确立一个连贯的主体,然后通过额外的媒体内容指导其动作、镜头、语音或场景。在最终生成的完整结果中,评估主体一致性、身体结构、表情和表演节奏。
将脚本大纲转化为结合了动作、镜头语言、氛围和音视频节奏的短场景。在投入实景拍摄或详细的后期制作之前,使用生成的素材来评估创意。
通过自然语言指令和可选的参考素材,探索风格、环境、主体或场景的变化。逐帧检查时间边界、遮挡、意外修改以及源细节的保留情况。
已在 APIXO 线上部署环境中确认。
文本 / 图像 / 视频 / 音频
输入
文生视频 / 图生视频 / 参考
工作流
768P / 2K
分辨率
5–15 秒
时长
原生立体
音频
6 种宽高比 + 自适应
构图
MiniMax H3 通过 APIXO 的异步任务接口地址运行。您可以提交任务至 generateTask 并轮询 statusTask,或提供一个回调 URL 以通过 webhook 接收结果。
提供三种模式:文生视频、图生视频和参考视频生成。图生视频模式接受 1-2 张图片作为第一帧和可选的最后一帧;参考视频生成模式需要至少一个图片或视频参考。
输出 768p 或 2K 视频,时长为 5-15 秒(仅限整数秒)。分辨率决定了每秒费率。提示词限制在 4000 个字符以内。参考视频和音频文件分别最多 3 个,单个文件时长 2-15 秒,总时长不超过 15 秒。
“MiniMax H3”是 APIXO 的模型 ID。请勿沿用 Hailuo 2.3 或 Hailuo 2.3 Fast 的参数值、质量等级或计费方式——它们是具有不同合约的独立接口。
参考可引导生成,但不能保证精确还原身份、字体、标志、材质或产品几何形状。
发布前请审核解剖结构、手部、物体接触、快速运动、遮挡、镜头过渡、语音和音画同步等细节。
是的。该模型已在 APIXO 异步任务接口地址上线,您可以使用与其他所有模型相同的 API 密钥进行调用。您也可以在本页的 Playground 中进行生成。
文生视频、图生视频和参考视频生成。参考视频生成模式最多可接受 9 张图片、3 个视频和 3 个音频文件作为组合创意素材;音频不能单独提供。
输出 768p 或 2K 分辨率的视频,时长为 5 到 15 秒(仅限整数秒)。2K 是默认分辨率,也是该接口提供的最高级别;768p 按较低的每秒费率计费。文生视频和参考图/视频生成模式下,宽高比可设置为 21:9、16:9、4:3、1:1、3:4 或 9:16;图生视频的画面构图将采用所提供的第一帧。
在所有模式下,输出视频均按秒计费,费率与您选择的分辨率相对应——768p 的每秒费用低于 2K。在参考生成模式下,参考视频的实际秒数按相同的每秒费率计费,前 5 张参考图免费,超出部分按张单独收费。参考音频不计费。当前费率请参见“定价”标签页。
是的。音频与画面在同一次处理中生成原生立体声,其中语音、音效、环境声和音乐是联合建模生成的,而非作为独立音轨。
否。混合媒体参考可传达创作意图,但不能保证精确还原身份、动作、声音、产品结构或实现帧级复刻。用于生产环境前,需要进行视觉和音频审核。
探索更多 AI 模型,赋能您的创意工作流