APIXO
视频生成原生音频关键帧控制

APIXO 上的 Seedance 1.5 Pro 对应字节跳动公开发布的音视频联合模型 Seed。它能根据文本或一至两张关键帧创建短视频,并可选择同步声音、控制 4–12 秒时长以及选择镜头行为。该路由专注于直接生成,而非 Seedance 2.0 更广泛的多模态参考工作流。

工作流

文/图生视频

APIXO 价格

$0.0108-$0.1044 / 秒

分辨率

480p / 720p / 1080p

时长

4–12 秒

发布于

2025年12月16日

使用 Seedance 1.5 Pro 创作

正在加载工作区...

由字节跳动提供技术支持

在同一个短视频工作流中协调生成声音和动作

Seedance 1.5 Pro 在 Seedance 1.0 纯视觉生成的基础上进一步发展,能够联合生成视频和音频。通过 APIXO,团队可以根据提示词和关键帧创建无声片段或音画同步的场景,同时控制构图、时长、分辨率和镜头稳定性。

能力

协调表演、声音、镜头和叙事意图

音视频联合生成

将视觉运动和声音一起生成,使人声、表演时机、环境音和空间效果能够响应相同的场景描述。APIXO 也允许生成无声视频。

音视觉对齐

比独立的视频制作和后期配音流程更紧密地协调口型运动、声调变化、动作节奏和环境音,但仍可能存在生成过程中的计时误差。

语言和方言范围

ByteDance 的文档提及支持多种语言和地区方言,包括它们的声韵和情感表达。对于每种制作语言,都应审查其发音和同步效果。

可指导的运镜

在生成的短序列中,解析关于特写、连续运动、滑动变焦、场景转换、灯光和色彩处理的摄像机与场面调度指令。

叙事协调

围绕提示词的叙事意图,将对话、表情、角色动作和镜头发展连接起来,生成比孤立的动作生成更具凝聚力的短场景。

图像引导的动画生成

将提供的起始图像生成动画,或在定义的开始和结束帧之间引导过渡,同时在生成条件允许的情况下保留源图像的构图和外观。

APIXO 工作流

通过文本自由生成,或通过关键帧控制动画

文生视频

提交 3-2500 个字符的提示词,描述场景、动作、镜头方向、光照和音频提示。选择时长、分辨率、画幅、声音和镜头行为,即可在没有图像输入的情况下创建新片段。

提示词引导的创作

图生视频

提供一个公开的图像 URL 作为起始帧,或提供两个 URL 按顺序作为起始和结束帧。添加一个必需的提示词,以指导这些视觉锚点之间的运动、过渡、镜头处理和可选的生成配乐。

关键帧引导的运动
APIXO 配置

经验证的生成控制

APIXO 当前 Seedance 1.5 Pro API 开放的生成选项。

3–2,500 字符

提示词长度

1–2 个 URL

图像输入

开始 / 结束

画面角色

6 种比例 + 自动

宽高比

开 / 关

已生成声音

开 / 关

固定镜头

生产应用

根据简报和关键帧构建简短的视听场景

品牌故事叙述

带声音的产品时刻

将营销文案或已批准的产品图转化为包含协调运镜、氛围和特效的短预告片。使用固定镜头模式进行可控构图,并在发布前检查产品形状、标签、材质和嵌入文本。

角色内容

对话主导的表演

创建紧凑的主持人、角色或戏剧场景,其中口头表达、面部表情和身体动作都由同一个提示词驱动。请检查说话者的身份、发音、口部动作、手部和情感时机,而不要认为同步是绝对保证的。

预可视化

规划镜头运动

在投入实景拍摄或动画制作前,探索连续镜头、重新构图、推拉式运镜和过渡效果。起始帧和结束帧为过渡和故事板开发提供了有用的视觉边界。

社交媒体创意

制作简短叙事片段

生成 4-12 秒的视频场景,适用于竖屏信息流、宽屏广告位、预告片或系列概念片。原生音频可以营造氛围、控制表演节奏,无需单独进行配乐生成。

说明与常见问题

Seedance 1.5 Pro 的运行限制

实现说明

01

APIXO 仅提供文生视频和图生视频;文档中未提及视频输入、扩展、编辑、运动参考或多图像参考模式。

02

图生视频需要一个或两个 URL;提供两个图像时,第一个是起始帧,第二个是结束帧。

03

APIXO 接受 4 到 12 秒之间的任意整数时长。

04

音频开关用于选择联合生成音效或输出无声视频;由于此路由不接受源视频或音频,因此不会保留源音频。

05

APIXO 的典型处理时间:4 秒视频片段约需 40-60 秒,12 秒视频片段约需 90-120 秒;实际延迟会有所不同。

06

参考图必须使用可公开访问的 JPG、PNG 或 WebP 格式的 URL,并受上游供应商的安全检查约束。

常见问题解答

不是。Seedance 1.5 Pro 是字节跳动于 2025 年 12 月发布的音视频联合模型。APIXO 将其提示词和关键帧工作流与 Seedance 2.0、Seedance 2.0 Fast 及其更广泛的参考能力分开提供。

字节跳动展示了与视觉效果协调的多样化人声和空间音效。其演示中还包括声乐表演和环境音,但 APIXO 仅提供一个统一的音频开关,而非独立的对话、音乐、氛围或音效控制。

APIXO 根据分辨率和音频设置按秒计费。480p 分辨率下,无声输出每秒 $0.0108,有声输出每秒 $0.0216。720p 分辨率下,费用分别为 $0.0234 和 $0.0468。1080p 分辨率下,费用分别为每秒 $0.0522 和 $0.1044。

可以。在图生视频模式下提供两个图片 URL:第一个作为起始帧,第二个作为结束帧。如果只提供一张图片,则该图片将作为起始帧。

检查解剖结构、手部、身份稳定性、物体接触、嵌入文本、过渡、发音、口型同步以及说话者的演绎。较长或快速变化的场景可能需要优化提示词或多次生成。

探索其他模型

探索更多 AI 模型,赋能您的创意工作流