该路由提供文生视频、图生视频、参考图生视频和视频编辑功能。这些是独立的工作流,各有不同的提示词、媒体、宽高比、时长、音频和计费规则;在一种模式下有效的字段不应假定在另一种模式下也有效。
APIXO 上的 Wan 2.7 Video 将阿里的四种视频工作流整合至一个操作路径:提示词主导创作、帧引导动画、多模态参考生成和指令式视频编辑。您可以生成 720p 或 1080p 的视频片段,并针对不同模式使用特定的视觉、音频、时长和画面控制,适用于广告、叙事开发、本地化和后期制作流程。
模式
文本 · 图像 · 参考 · 编辑
APIXO 价格
始于 $0.10 / 秒后端按秒计费的视频接口
分辨率
720p · 1080p
输出时长
最长 15 秒
交付
MP4 URL · 异步
正在加载工作区...
文生视频可将中文或英文描述转换为 2-15 秒的视频片段。在最多 5000 个字符的提示词中定义主体、动作、镜头行为、场景发展和声音方向。
图生视频可以为单个起始帧生成动画,连接起始帧和结束帧,或基于源视频进行续写并朝可选的最终帧目标过渡。当提供的视觉素材已足以构成场景时,提示词是可选的。
参考图/视频生视频功能最多可合并五个有序的图像和视频参考资料。使用它们来确定主体、外观、动态或场景背景,而不必将每个参考资料都视为固定的输出帧。
参考请求可以将公开的音频文件与单个参考槽位关联。APIXO 会将图像槽位置于视频槽位之前,并在靠后的参考需要音频但靠前的参考不需要时接受空的占位符。
视频编辑功能将书面的转换指令应用于一个 2-10 秒的现有视频片段,并可额外整合最多四张辅助图像。它适用于风格变更和引导性的视觉修订,而非基于时间轴的手动编辑。
在兼容的生成工作流中,Wan 2.7 支持同步音视频输出和可选的自定义音频。多镜头结构可以通过提示词描述,但 APIXO 在此路由上未提供专用的 `shot_type` 参数。
APIXO 可用接口的特定模式输入、时长限制和交付规则。
720p / 1080p
分辨率
16:9 / 9:16 / 1:1 / 4:3 / 3:4
宽高比
2–15 秒
文字 / 图像
2–15 秒 · 视频模式 10 秒
参考
0 或 2–10 秒
视频编辑
轮询或回调
交付
将处理方案和镜头描述转化为简短的视听场景,用于方案开发、故事探索和预可视化。多镜头提示有助于在概念阶段无需源素材的情况下传达一系列动作的进展。
为提供的产品构图、主视觉、插画或起始帧制作动画。当最终构图很重要时,可以添加一个可选的结束帧,并在发布前检查精细的几何形状、嵌入文本和品牌细节。
结合主体图像、表演镜头和与时间轴对齐的语音参考,围绕重复出现的视觉元素开发营销活动场景。复杂的身份、互动、语音和快速运动可能仍需要多次生成和人工审核。
提交一个简短的源视频片段,附上转换说明和可选的视觉参考,以探索新的处理方式、环境或艺术方向。您可以选择让 Wan 决定如何处理音频,或保留原始音轨。
文生视频和参考图生视频都需要提供提示词;APIXO 当前的详细路由文档也要求视频编辑功能使用非空的提示词。
图生视频模式接受一或两张帧图像,或一个 2–10 秒的续写视频,最多可再附带一张可选的结束帧图像。
参考图/视频生视频需要 1-5 个图像和视频参考资料的组合;添加任何视频参考都会将最大输出时长缩短至 10 秒。
视频编辑需要且仅需要一个时长在 2 到 10 秒之间的公开 MP4 或 MOV 源视频片段,并支持最多四个可选的参考图。
图生视频模式不支持设置宽高比,因为其画面取自提供的源图像;其他模式则应用其文档中规定的宽高比规则。
固定的种子值可以提高可复现性,但不能保证输出完全相同。启用水印会在右下角添加固定的“AI 生成”文字。
该路由提供文生视频、图生视频、参考图生视频和视频编辑功能。这些是独立的工作流,各有不同的提示词、媒体、宽高比、时长、音频和计费规则;在一种模式下有效的字段不应假定在另一种模式下也有效。
文生视频、图生视频和视频编辑在 720p 分辨率下每计费秒消耗 $0.10 积分,在 1080p 分辨率下消耗 $0.15 积分。参考图/视频生视频在 720p 分辨率下每秒消耗 $0.15 积分,在 1080p 分辨率下消耗 $0.24 积分。
APIXO 的视频编辑费用根据输入视频截取时长和请求的输出视频时长计算。当 duration=0 时,输出时长与源视频一致,计费秒数等于输入视频截取时长的两倍。当请求输出 2-10 秒时,APIXO 会将该时长加到输入视频截取时长上进行计费。
audio_setting 仅属于 video-edit。auto 让模型决定提示词中的声音指令是否需要重新生成音频,否则可能保留源音频。origin 强制保留输入音频并跳过重新生成。
APIXO 按顺序将 audio_urls 映射到参考图槽位,所有图片参考在前,视频参考在后。使用空字符串可以跳过一个槽位而不影响后续音频的排列。每个非空条目都将作为其关联参考内容的语音指导。
探索更多 AI 模型,赋能您的创意工作流