APIXO
$0.0525 / 秒 起三种参考输入类型智能时长

Wan 3.0 Video LoRA 支持通过文本、首尾帧,或融合图像、视频及音频参考来生成视频。您可以选择 480p, 720p, 1080p 输出、设置明确的视频长度,或由智能时长自动决定。

模式

文本 / 图像 / 参考

APIXO 价格

$0.0525 / 秒 起

时长

智能或 2–30 秒

参考类型

图片 / 视频 / 音频

分辨率

480p / 720p / 1080p

使用 Wan 3.0 Video LoRA 创作

LoRA 微调视频生成

利用图像、视频片段、音频和智能时长导演视频

Wan 3.0 Video LoRA 将三种参考输入类型整合至单个视频 API 中。您可以从文本或首尾帧开始生成,或在 reference-to-video 模式下组合多种参考媒介,同时自主选择输出分辨率、画幅、声音和时长控制。

能力

面向 LoRA 引导创意简报的参考工具包

三种参考通道

使用图像、视频或音频来引导参考视频请求,而无需将所有指令都压缩到提示词中。

首尾帧图像

图生视频最多支持 2 张图片(即起始帧及可选的结束帧)。参考模式最多支持 10 张图片。

视频参考引导

最多可附加 5 个参考视频,每个视频的时长在 1–15 秒之间,且参考视频的总时长最多不超过 15 秒。参考视频的实际时长将按所选分辨率的费率计费。

音频参考,无额外费用

在参考模式下,最多可添加 5 个音频参考,每个时长为 1–15 秒。使用音频参考可引导生成方向,且无需支付额外的音频输入费用。

除文本模式外,提示词可选

仅 text-to-video 模式需要提示词。当所提供的媒体已包含创意意图时,image-to-video 和 reference-to-video 模式可接受空提示词。

智能时长

开启“智能时长”以让模型决定输出长度,或选择 2 至 30 秒之间的任意整数来显式指定片段时长。

模型详情

已发布的 Wan 3.0 Video LoRA API 参数

3 种生成模式

模式

480p / 720p / 1080p

分辨率

智能或 2–30 秒

时长

最多 10 张图片

图像参考

最多 5 个视频

视频参考

默认启用

声音

应用场景

利用丰富的参考上下文,提升视频生成质量

视觉连续性

参考引导式场景开发

在单次图/视频生视频请求中,您可以结合使用参考图和简短的视频片段,以明确传达主体、视觉风格和运动轨迹。

定时转场

首尾帧动态

当所需视频片段需要在两个已知的视觉状态之间转换时,可提供一张起始图像和一张可选的结束图像。

多媒体参考

音频引导的参考内容

若生成的视频片段需要契合节奏、氛围或旁白音轨,可在视觉简报中扩展引入音频参考。

自适应时长

智能时长创意探索

当视频片段长度需要随生成结果自动适配时,可使用智能时长(smart duration)功能;在需要精准控制的正式生成中,可切换为固定的 2–30 秒时长。

说明与常见问题

Wan 3.0 Video LoRA 输入与计费指南

备注

01

仅 text-to-video 模式需要提示词,image-to-video 和 reference-to-video 模式支持空提示词。

02

智能时长使用 -1。后端将首先预扣 30 秒的费用,随后根据生成成功的视频实际时长进行结算并退还差额。

03

参考视频按秒计费,采用与输出视频相同的分辨率费率。参考音频不收取单独输入费用。

04

对于固定的正数时长,输出秒数加上参考视频总秒数不能超过 30 秒。

05

声音默认启用,且不影响价格。当请求需要生成无声片段时,请将 `sound` 参数设置为 `false`。

06

视频参考支持最多 10 张图片、5 个视频和 5 个音频文件。每个参考视频或音频文件时长须在 1–15 秒之间,且每种媒体类型的总时长最多为 15 秒。

常见问题解答

它支持 text-to-video、image-to-video 和 reference-to-video。所有 3 种模式均提供 480p / 720p / 1080p 输出。

输出时长按秒计费,单价为每秒 $0.0525 至 $0.21,具体仅取决于输出分辨率 —— 费率表列出了所有档位。所有 3 种生成模式共享相同的费率;视频参考生成(reference-to-video)会额外按参考视频的实际时长计费。

当 duration 为 -1 时,由于最终时长尚不可知,后台会预扣 30 秒的费用。生成成功后,将根据实际时长进行结算并退还差额。

参考转视频支持图片、视频和音频。最高支持 10 张图片、5 个视频和 5 个音频参考,每个参考视频或音频文件的时长为 1–15 秒。

不会。参考视频的每一秒都按所选分辨率费率计费,而参考音频不收取单独的输入费用。

两款模型支持相同的参数和模式。当前模型输出 480p, 720p, 1080p,而 Pro 模型则将上限提升至 1080p, 2K, 4K,并按其自身的每秒费率计费。

探索其他模型

探索更多 AI 模型,赋能您的创意工作流