它支持 text-to-video、image-to-video 和 reference-to-video。所有 3 种模式均提供 480p / 720p / 1080p 输出。
Wan 3.0 Video LoRA
Wan 3.0 Video LoRA 支持通过文本、首尾帧,或融合图像、视频及音频参考来生成视频。您可以选择 480p, 720p, 1080p 输出、设置明确的视频长度,或由智能时长自动决定。
模式
文本 / 图像 / 参考
APIXO 价格
$0.0525 / 秒 起
时长
智能或 2–30 秒
参考类型
图片 / 视频 / 音频
分辨率
480p / 720p / 1080p
使用 Wan 3.0 Video LoRA 创作
正在加载工作区...
面向 LoRA 引导创意简报的参考工具包
三种参考通道
通过图像、视频或音频引导“参考至视频”请求,无需将所有指令都压缩到提示词中。
首尾帧图像
图生视频最多支持 2 张图片(即起始帧及可选的结束帧)。参考模式最多支持 10 张图片。
视频参考引导
最多可附加 5 个参考视频,每个视频的时长在 1–15 秒之间,且参考视频的总时长最多不超过 15 秒。参考视频的实际时长将按所选分辨率的费率计费。
音频参考,无额外费用
在参考模式下,最多可添加 5 个音频参考,每个时长为 1–15 秒。使用音频参考可引导生成方向,且无需支付额外的音频输入费用。
非文本模式下提示词可选
仅 text-to-video 模式需要提示词。当所提供的媒体已包含创意意图时,image-to-video 和 reference-to-video 模式可接受空提示词。
智能时长
开启“智能时长”以让模型决定输出长度,或选择 2 至 30 秒之间的任意整数来显式指定片段时长。
已发布的 Wan 3.0 Video LoRA API 参数
3 种生成模式
模式
480p / 720p / 1080p
分辨率
智能或 2–30 秒
时长
最多 10 张图片
图像参考
最多 5 个视频
视频参考
默认启用
声音
利用丰富的参考上下文,提升视频生成质量
参考引导式场景开发
在单次图/视频生视频请求中,您可以结合使用参考图和简短的视频片段,以明确传达主体、视觉风格和运动轨迹。
首尾帧动态
当所需视频片段需要在两个已知的视觉状态之间转换时,可提供一张起始图像和一张可选的结束图像。
音频引导的参考内容
若生成的视频片段需要契合节奏、氛围或旁白音轨,可在视觉简报中扩展引入音频参考。
智能时长创意探索
当视频片段长度需要随生成结果自动适配时,可使用智能时长(smart duration)功能;在需要精准控制的正式生成中,可切换为固定的 2–30 秒时长。
Wan 3.0 Video LoRA 输入与计费指南
备注
仅 text-to-video 模式需要提示词,image-to-video 和 reference-to-video 模式支持空提示词。
智能时长使用 -1。后端将首先预扣 30 秒的费用,随后根据生成成功的视频实际时长进行结算并退还差额。
参考视频时长按与输出视频相同的分辨率费率计费。参考音频不单独收取输入费用。
对于固定的正数时长,输出秒数加上参考视频总秒数不能超过 30 秒。
默认启用声音,且不改变价格。如果请求需要生成无声片段,请将 sound 参数设置为 false。
视频参考支持最多 10 张图片、5 个视频和 5 个音频文件。每个参考视频或音频文件时长须在 1–15 秒之间,且每种媒体类型的总时长最多为 15 秒。
常见问题解答
输出时长按秒计费,单价为每秒 $0.0525 至 $0.21,具体仅取决于输出分辨率 —— 费率表列出了所有档位。所有 3 种生成模式共享相同的费率;视频参考生成(reference-to-video)会额外按参考视频的实际时长计费。
当 duration 为 -1 时,由于最终时长尚不可知,后台会预扣 30 秒的费用。生成成功后,将根据实际时长进行结算并退还差额。
参考转视频支持图片、视频和音频。最高支持 10 张图片、5 个视频和 5 个音频参考,每个参考视频或音频文件的时长为 1–15 秒。
否。参考视频的每一秒都按所选分辨率的费率计费,而参考音频不会产生额外的输入费用。
两款模型支持相同的参数和模式。当前模型输出 480p, 720p, 1080p,而 Pro 模型则将上限提升至 1080p, 2K, 4K,并按其自身的每秒费率计费。
探索其他模型
探索更多 AI 模型,赋能您的创意工作流
