文生视频和图生视频在 720p 分辨率下每秒花费 $0.10,1080p 分辨率下每秒花费 $0.15。参考图生成视频在 720p 分辨率下每秒花费 $0.20,1080p 分辨率下每秒花费 $0.30。总费用为所选时长乘以适用的费率。
Wan 2.6 Video 是 APIXO 提供的视频生成路由,支持五种阿里巴巴视频生成工作流。您可以根据文本创建音视频片段、为单张源图生成动画,或使用有序的图像和视频参考来指导角色。标准和 Flash 模式提供 720p 或 1080p 输出、多镜头控制、自定义音频,以及特定于模式的时长和定价。
工作流
文本 / 图像 / 参考
APIXO 价格
$0.025–$0.30 / 秒后端定价的标准和 Flash 路由
分辨率
720p / 1080p
时长
2–15秒 · 参考 ≤10秒
参考图限制
最多 5 个文件
正在加载工作区...
无需源图像,通过必需的中英文提示词描述主体、动作、场景、镜头行为、对话和声音来创建视频。
Standard 和 Flash 图像模式仅能将一张源图像动画化。提示词仍为必需项,用于指导初始视觉状态下的运动、镜头行为和场景发展。
参考模式接受有序的图片和视频 URL,这些 URL 对应 character1、character2 及后续角色,用于外观、动作、场景或可用的语音引导。
选择“单镜头”生成一个连续镜头,或选择“多镜头”生成一系列变化的镜头。此处的明确设置将优先于提示词中可能冲突的镜头指令。
提交一个可选的 MP3 或 WAV 文件以实现自定义同步,或让支持音频的生成模式产出视听内容,但不保证精确的对话、发音或口型同步。
使用负向提示词、提示词扩展和数值种子值来优化输出。固定种子值有助于控制迭代过程,但无法使概率性生成变为确定性结果。
Standard 路由涵盖文生视频、图生视频和参考图生视频。文生视频和图生视频模式支持 2–15 秒,而参考图生视频模式支持 2–10 秒。在这些模式下,sound 字段无效。
Flash 路由仅适用于图生视频-flash 和参考图生视频-flash。其声音控制默认为 true;禁用它会产生无声输出、忽略提供的音频,并适用更低的 Flash 费率。
通过 APIXO 开放的特定模式输入及限制。
5
生成模式
1–1,500
提示词字符数
1 张图片
图像模式输入
1–5 个文件
参考图输入
1 个 MP3 / WAV
自定义音频
轮询 / 回调
结果交付
在投入实景拍摄或精细的后期制作之前,使用文生视频和多镜头控制来探索简短的宣传片叙事、镜头切换和场景进展。请检查生成视频中的身体结构、物体接触、标志和嵌入文本。
通过标准 (Standard) 或快速 (Flash) 路由,将一张已审核的产品图片、插图或宣传视觉图制作成动态视频。将生成结果与源文件在几何形状、比例、构图和品牌保真度方面进行比较。
为角色分配有序的图片或视频参考,用于短对话和多角色场景。在每个结果中验证身份、位置、声音漂移、对话归属、发音和口型动作。
提供旁白、音乐或音效来指导一段简短的宣传片。发布前请检查时序和同步效果,或在仅需低成本视觉草稿时禁用 Flash 音频功能。
APIXO 提供五种产品模式,但未公开每个路由背后所选用的确切上游检查点或快照。
每种模式都需要一个最多 1,500 个字符的非空提示词;可选的负向提示词最多支持 500 个字符。
图像模式需要一个公开可访问的 JPEG、JPG、无 Alpha 通道的 PNG、BMP 或 WebP 图片 URL,文件大小不超过 20MB,尺寸在 240–8000 像素之间。
参考模式接受一到五个有序文件:最多五个图像、最多三个 MP4 或 MOV 视频,且文件总数不超过五个。
自定义音频接受一个公开的 MP3 或 WAV URL,时长 3-30 秒,大小不超过 15MB;超出的音频部分将被截断,而过短的输入则会在剩余部分保持静音。
APIXO 未公布此路由的结果 URL 保留期限。建议在文生/图生模式下 30 秒后、参考模式下 45 秒后轮询,或使用回调来接收最终结果;完成后请及时存储所需输出。
文生视频和图生视频在 720p 分辨率下每秒花费 $0.10,1080p 分辨率下每秒花费 $0.15。参考图生成视频在 720p 分辨率下每秒花费 $0.20,1080p 分辨率下每秒花费 $0.30。总费用为所选时长乘以适用的费率。
图生视频 Flash 模式在 720p/1080p 分辨率下,无声每秒费用为 $0.025/$0.0375,有声为 $0.05/$0.075。参考图视频 Flash 模式无声每秒费用为 $0.05/$0.08,有声为 $0.10/$0.16。
只有 image-to-video-flash 和 reference-to-video-flash 接受声音输入,且默认为 true。当设为 false 时,生成的视频将是无声的,任何提供的 audio_urls 值都将被忽略。
将 `shot_type` 设置为 `multi` 并保持 `prompt_extend` 启用,以便 Wan 2.6 能够重写和优化镜头描述。当场景需要保持为单个连续镜头时,请使用 `single`。
任务状态包括等待中、处理中、成功和失败。成功的视频 URL 会出现在 resultJson.resultUrls 中;失败的任务会提供 failCode 和 failMsg。使用回调方式接收结果需要一个可访问的公共回调接口地址。
探索更多 AI 模型,赋能您的创意工作流