不是。Seedance 1.5 Pro 是字节跳动于 2025 年 12 月发布的音视频联合模型。APIXO 将其提示词和关键帧工作流与 Seedance 2.0、Seedance 2.0 Fast 及其更广泛的参考能力分开提供。
Seedance 1.5 Pro
APIXO 上的 Seedance 1.5 Pro 对应字节跳动公开发布的音视频联合模型 Seed。它能根据文本或一至两张关键帧创建短视频,并可选择同步声音、控制 4–12 秒时长以及选择镜头行为。该路由专注于直接生成,而非 Seedance 2.0 更广泛的多模态参考工作流。
工作流
文/图生视频
APIXO 价格
$0.0108-$0.1044 / 秒
分辨率
480p / 720p / 1080p
时长
4–12 秒
发布于
2025年12月16日
使用 Seedance 1.5 Pro 创作
正在加载工作区...
协调表演、声音、镜头和叙事意图
音视频联合生成
将视觉运动和声音一起生成,使人声、表演时机、环境音和空间效果能够响应相同的场景描述。APIXO 也允许生成无声视频。
音视觉对齐
比独立的视频制作和后期配音流程更紧密地协调口型运动、声调变化、动作节奏和环境音,但仍可能存在生成过程中的计时误差。
语言和方言范围
ByteDance 的文档提及支持多种语言和地区方言,包括它们的声韵和情感表达。对于每种制作语言,都应审查其发音和同步效果。
可指导的运镜
在生成的短序列中,解析关于特写、连续运动、滑动变焦、场景转换、灯光和色彩处理的摄像机与场面调度指令。
叙事协调
围绕提示词的叙事意图,将对话、表情、角色动作和镜头发展连接起来,生成比孤立的动作生成更具凝聚力的短场景。
图像引导的动画生成
将提供的起始图像生成动画,或在定义的开始和结束帧之间引导过渡,同时在生成条件允许的情况下保留源图像的构图和外观。
通过文本自由生成,或通过关键帧控制动画
文生视频
提交 3-2500 个字符的提示词,描述场景、动作、镜头方向、光照和音频提示。选择时长、分辨率、画幅、声音和镜头行为,即可在没有图像输入的情况下创建新片段。
图生视频
提供一个公开的图像 URL 作为起始帧,或提供两个 URL 按顺序作为起始和结束帧。添加一个必需的提示词,以指导这些视觉锚点之间的运动、过渡、镜头处理和可选的生成配乐。
经验证的生成控制
APIXO 当前 Seedance 1.5 Pro API 开放的生成选项。
3–2,500 字符
提示词长度
1–2 个 URL
图像输入
开始 / 结束
画面角色
6 种比例 + 自动
宽高比
开 / 关
已生成声音
开 / 关
固定镜头
根据简报和关键帧构建简短的视听场景
带声音的产品时刻
将营销文案或已批准的产品图转化为包含协调运镜、氛围和特效的短预告片。使用固定镜头模式进行可控构图,并在发布前检查产品形状、标签、材质和嵌入文本。
对话主导的表演
创建紧凑的主持人、角色或戏剧场景,其中口头表达、面部表情和身体动作都由同一个提示词驱动。请检查说话者的身份、发音、口部动作、手部和情感时机,而不要认为同步是绝对保证的。
规划镜头运动
在投入实景拍摄或动画制作前,探索连续镜头、重新构图、推拉式运镜和过渡效果。起始帧和结束帧为过渡和故事板开发提供了有用的视觉边界。
制作简短叙事片段
生成 4-12 秒的视频场景,适用于竖屏信息流、宽屏广告位、预告片或系列概念片。原生音频可以营造氛围、控制表演节奏,无需单独进行配乐生成。
Seedance 1.5 Pro 的运行限制
实现说明
APIXO 仅提供文生视频和图生视频;文档中未提及视频输入、扩展、编辑、运动参考或多图像参考模式。
图生视频需要一个或两个 URL;提供两个图像时,第一个是起始帧,第二个是结束帧。
APIXO 接受 4 到 12 秒之间的任意整数时长。
音频开关用于选择联合生成音效或输出无声视频;由于此路由不接受源视频或音频,因此不会保留源音频。
APIXO 的典型处理时间:4 秒视频片段约需 40-60 秒,12 秒视频片段约需 90-120 秒;实际延迟会有所不同。
参考图必须使用可公开访问的 JPG、PNG 或 WebP 格式的 URL,并受上游供应商的安全检查约束。
常见问题解答
字节跳动展示了与视觉效果协调的多样化人声和空间音效。其演示中还包括声乐表演和环境音,但 APIXO 仅提供一个统一的音频开关,而非独立的对话、音乐、氛围或音效控制。
APIXO 根据分辨率和音频设置按秒计费。480p 分辨率下,无声输出每秒 $0.0108,有声输出每秒 $0.0216。720p 分辨率下,费用分别为 $0.0234 和 $0.0468。1080p 分辨率下,费用分别为每秒 $0.0522 和 $0.1044。
可以。在图生视频模式下提供两个图片 URL:第一个作为起始帧,第二个作为结束帧。如果只提供一张图片,则该图片将作为起始帧。
检查解剖结构、手部、身份稳定性、物体接触、嵌入文本、过渡、发音、口型同步以及说话者的演绎。较长或快速变化的场景可能需要优化提示词或多次生成。
探索其他模型
探索更多 AI 模型,赋能您的创意工作流