视频生成多模态参考生成音频

Seedance 2.0 Fast 是 APIXO 为字节跳动 Seedance 2.0 提供的速度优先路由,并非一个独立记录的上游字节跳动模型变体。它支持提示词生成、首尾帧动画和多模态参考工作流,可选生成声音和网络搜索,输出时长为 4-15 秒,分辨率为 480p 或 720p。

APIXO 模式

3 个工作流

APIXO 价格

$0.044–$0.16 / 秒

分辨率

480p / 720p

时长

4–15 秒

Seedance 2.0 发布

2026年2月12日

使用 Seedance 2.0 Fast 创作

正在加载工作区...

由 APIXO 路由

通过专用的 Fast 通道访问聚焦的 Seedance 2.0 工作流

字节跳动官方将 Seedance 2.0 定义为统一的多模态音视频模型,并未单独发布 Seedance 2.0 Fast 模型。APIXO 的 Fast 命名仅用于标识此特定通道及其已验证的控件、定价和交付行为,并不代表其为官方确认的架构变体或量化的速度提升。

能力

使用提示词、关键帧和混合参考来指导运动

多模态条件

将提示词与图像、视频和音频参考相结合,使生成内容能够借鉴视觉构图、运动、镜头处理、特效或声音相关的上下文。

关键帧约束的动态生成

将运动锚定在提供的第一帧,或指定在明确的第一帧和最后一帧之间进行过渡,而不将它们作为通用参考图处理。

由参考主导的一致性

将可识别的主体、环境、视觉风格和运动线索带入新序列。保真度仍依赖于生成效果,当参考内容存在冲突时可能会减弱。

音视频同步输出

在生成视频的同时生成声音,使音频事件能与场景的时序和视觉动作保持同步。APIXO 也允许通过其声音控制选项输出无声视频。

复杂动态处理

与 Seedance 1.5 Pro 相比,Seedance 2.0 在多主体互动和高难度运动场景中提升了物理准确性和稳定性。

镜头与叙事控制

在选定的输出时长内,解读提示词和参考素材,以控制镜头运动、光照、表演、转场和多镜头叙事结构。

APIXO 配置

特定模式的生成限制

已验证的控制功能可通过 Seedance 2.0 Fast 路径使用。

3

生成模式

4–15 秒

输出时长

6 种比例 + 自动

宽高比

1–9 张图像

Omni 图像输入

1–3 个视频

视频参考

1–3 个音频文件

音频参考

生产应用

根据不同层级的创意指导构建短视频

快速概念设计

由提示词主导的场景探索

将书面简报转化为横向、纵向、方形或超宽屏的短视频概念,并可选配声音。此工作流无需源素材,适用于早期营销活动构思、故事板替代方案、视觉提案以及社交内容创意。

可控动画

为已批准的关键帧生成动画

将静态图片转化为动态视频,或连接所提供的首尾两帧。此功能适用于产品亮相、故事板转场、片头序列、角色特写以及注重起止画面的设计主导型片段。

品牌内容生产

结合营销活动参考

提供产品图、环境图片、动态素材和可选的音频提示,以指导广告或发布概念的创作。在用于生产前,请检查品牌元素、身份一致性、物体几何形状、接触点和参考冲突。

运动适应

转化运动与节奏

使用参考视频和音频作为条件,为新生成的片段赋予镜头语言、动作节奏、表演韵律或视觉效果。该路径不保证直接编辑源视频或保留原始音频。

使用参考图

在组合源素材前选择工作流

APIXO 的每种模式都接受不同的参考组合,并会拒绝不支持的组合方式。

从文本或关键帧开始

当需要用提示词定义整个场景时,请使用文生视频。当需要用一张图片确立开场,或用两张有序图片锁定视频的起止画面时,请选择首尾帧生成。

组合 Omni 参考

为了进行更广泛的条件控制,最多可组合九张图片、三个视频和三个音频文件。每个视频或音频文件时长必须在 2-15 秒之间,且每个参考媒体类别的总时长不超过 15 秒。

配置输出与交付

选择 480p 或 720p 分辨率、4 到 15 秒之间的整数时长、构图、生成声音,并可选地提供网页上下文。异步提交请求,然后通过轮询或回调获取生成的 MP4 文件。

说明与常见问题

路由识别、计费与参考约束

实现说明

01

字节跳动已公开 Seedance 2.0 的相关文档,但并未公开任何独立的上游 Seedance 2.0 Fast 模型或模型 ID。

02

首尾帧模式接受一或两张图片;第一张是起始帧,可选的第二张是结束帧。

03

“全能参考”接受混合媒体,但纯音频请求会被拒绝;至少需要一个图片或视频参考。

04

APIXO 默认启用声音生成,并允许无声输出;上传的音频仅作为条件引导,文档并未说明会保留源音频。

05

APIXO 的文档指出,所有三种工作流程的典型处理时间约为 3-6 分钟;此预估时间可能变化,并非延迟保证。

06

结果链接可能是临时性的,因此应及时下载并存储已完成的视频。

常见问题解答

Fast 是 APIXO 的一个独立路由,拥有其专属的模式、分辨率、参考限制和定价。字节跳动的公开资料并未将其标识为独立的 Fast 架构,也未量化其在速度或质量上的差异,因此不应预设这些对比。

在无视频输入的情况下,文生视频、首尾帧及全方位参考图生成,480p 分辨率下每输出一秒消耗 $0.08 积分,720p 分辨率下每输出一秒消耗 $0.16 积分。图片和音频参考不增加计费时长。

在 480p 分辨率下,费率为每秒 $0.044 积分;在 720p 分辨率下为 $0.0953 积分。APIXO 会根据此费率,按生成视频的时长与所有参考视频的总时长之和进行计费。

APIXO 文档未说明是否保留源音频。视频和音频文件为生成提供上下文,而声音设置则控制输出是否包含由模型生成的音频。

请检查解剖结构、手部、身份一致性、物体接触、快速运动、嵌入文本、参考保真度、转场、对话理解、发音和唇形同步。复杂或冲突的参考可能需要简化并重新生成。

探索其他模型

探索更多 AI 模型,赋能您的创意工作流