两种模式使用相同的 APIXO 费率:480p 每生成一秒 $0.05,720p $0.10,1080p $0.15。五秒输出的成本为 $0.25、$0.50 或 $0.75;十秒输出的成本为 $0.50、$1.00 或 $1.50。
APIXO 的 Wan 2.5 视频服务是调用阿里巴巴 Wan 2.5 视频模型系列的运营通道。您可以通过文本提示词或一张源图像,生成 5 秒或 10 秒的音视频片段,并支持自定义音频、三种分辨率等级、提示词扩展、负向提示词、基于种子值的迭代以及异步交付。
工作流
文/图生视频
APIXO 价格
$0.05–$0.15 / 秒后端定价的 480p、720p 和 1080p 等级
分辨率
480p / 720p / 1080p
时长
5 / 10 秒
输出
1 个 MP4 视频
正在加载工作区...
Wan 2.5 默认生成带音频的视频,而不是返回无声素材,从而减少了在单独的生成步骤中合成初始音轨的需求。
提供一个公开的 MP3 或 WAV 文件作为音频参考。Wan 会用它来使生成的视觉效果(在适用情况下,包括嘴型动作)与提供的音乐或画外音同步。但确切的措辞、发音、说话人身份和口型同步仍需人工审核。
使用最多 1,500 个字符的提示词,以中文或英文描述主题、动作、环境、相机行为、对话、音乐或音效。
为单个源图像制作动画,同时可使用可选的提示词来引导动态和场景发展。该图像确立了视觉背景,但不保证每个细节都得到精确保留。
默认启用提示词改写,以丰富较短的指令。当精确保留精心编写的措辞比潜在的创意收益更重要时,请禁用此功能。
使用负向提示词来避免不希望出现的特征,并使用数字种子值来提高可重复性。即使设置和种子值完全相同,也无法保证生成完全一样的视频。
在不提供源图片的情况下,提交一段必需的、非空的、最多 1,500 个字符的提示词。选择 5 秒或 10 秒的时长、三种分辨率之一以及兼容的宽高比。可通过可选的音频、负向提示词、提示词扩展、种子值和水印控件来优化请求。
提供一个公开的图片 URL,并可选择性地描述预期的运动或场景。在此模式下,请勿提交宽高比字段;源图片会引导初始的视觉状态和构图,但不保证完全保留身份特征、文本、Logo、几何形状、背景或画面框架。
wan-2-5-video 操作路由当前支持的生成选项。
1–1,500
提示词字符数
1 个公开 URL
源图片
1 个 MP3 / WAV
音频参考
500 个字符
负向提示词
0–2,147,483,647
种子值范围
轮询 / 回调
交付
将营销方案转化为带有初步音轨的简短产品亮相、生活方式场景或发布概念。在将创意投入制作前,请仔细审查产品的比例、物体接触、手部、Logo 和嵌入的文本。
使用单个源图像为产品摄影、插画、海报或角色艺术添加动态效果。生成后,请对照原始素材检查其身份、构图、背景和细节保真度。
将简短的音乐片段、旁白草稿或音效参考与生成的视觉效果配对,用于宣传和社交媒体的创意构思。独立验证口播措辞、发音、嘴型动作和视听同步时机。
通过生成简短的草稿来探索镜头方向、场景构图、动态效果以及培训或解说类视频的创意。在投入预算制作更长、更高分辨率的版本之前,可先使用较低分辨率、5 秒时长的生成内容进行快速迭代。
APIXO 通过单一路由提供阿里巴巴的 Wan 2.5 视频系列,但未公开记录其模式与 wan2.5-t2v-preview 和 wan2.5-i2v-preview 的具体对应关系。
图生视频接受单个公开的 JPEG、JPG、无 Alpha 通道的 PNG、BMP 或 WebP 图片 URL,大小不超过 20 MB;图片的每个维度都必须在 240–8,000 像素之间。
文生视频在所有分辨率下均支持 16:9、9:16 和 1:1 的宽高比;4:3 和 3:4 的宽高比需要 720p 或 1080p 分辨率。
可选的音频必须使用单个公开的 MP3 或 WAV URL,大小不超过 15 MB,其文档记录的时长范围为 3–30 秒。
典型的处理时间范围为:480p 分辨率下 40–120 秒,720p 分辨率下 60–180 秒,1080p 分辨率下 90–250 秒。APIXO 建议分别在 40 秒、60 秒或 90 秒后进行首次轮询,之后以 10 秒为间隔。这些时间仅为估算值,不构成服务等级协议(SLA)。
结果 URL 是临时的,没有固定的公开保留期限。请及时下载所需的输出内容,并审查其安全性及源材料的使用许可。
两种模式使用相同的 APIXO 费率:480p 每生成一秒 $0.05,720p $0.10,1080p $0.15。五秒输出的成本为 $0.25、$0.50 或 $0.75;十秒输出的成本为 $0.50、$1.00 或 $1.50。
长于所选视频时长的音频将被截断为前 5 或 10 秒。如果音频较短,则视频的剩余部分将为静音。APIXO 不会为自定义音频、图像输入或提示词扩展收取额外费用。
上游 Wan 2.5 模型可以在生成音频时,根据提示词描述的声音、音效和背景音乐进行创作。但 APIXO 不保证准确的对话内容、发音、声音特征、说话人归属或唇形同步,且不提供任何声音克隆相关的控制选项。
任务以异步方式运行,状态包括等待中、处理中、成功或失败。轮询调用会在 resultJson.resultUrls 中返回最终的 MP4 URL;回调模式则会将最终的有效负载发送到公共的 HTTPS 回调 URL。失败的任务会包含机器可读的 code 和 message 字段。
APIXO 不支持任意时长、自定义尺寸、可配置帧率、输出数量、CFG scale、运动强度、相机预设、镜头数量、参考权重、多镜头模式、编辑、续写或静音输出开关。启用 `watermark` 会在右下角添加固定的“AI 生成”文字。阿里巴巴文档指出其 Wan 2.5 Preview 输出为 30 fps H.264 MP4 格式,而 APIXO 未提供任何编解码器或帧率控制选项。
探索更多 AI 模型,赋能您的创意工作流