APIXO
视听一体视频文本或图片可选声音

快手的 Kling Video 2.6 模型可一次性生成短视频和可选的同步音频。通过 APIXO,开发者可以从文本或一张起始图片生成视频,选择添加一张结束帧,输出 5 秒或 10 秒的视频,并选择生成无声视频,或包含语音、音效、环境声和音乐的视频。

APIXO 工作流

文生视频 / 图生视频

无声视频价格

$0.30 / 视频起5 秒,无声音

带声音

$0.60 / 视频起5 秒,生成音频

时长

5 或 10 秒

发布于

2025年12月3日

使用 Kling 2.6 创作

正在加载工作区...

声音与动作同步

一次性生成视觉场景及其音轨

Kling Video 2.6 用同步音视频生成取代了先生成无声视频再配音的工作流。您可以直接在提示词中描述对话、旁白、歌唱、音乐、音效或环境氛围;如果倾向于使用独立的后期制作音频流程,也可以通过 APIXO 禁用声音生成。

能力

音频会根据场景内容生成,而非独立的音轨

音视频同步生成

Kling Video 2.6 在同一次模型处理中同时生成视觉和声音。这使得画面动作、人声节奏、环境事件与最终音轨的时机能够更紧密地协调。

多种声音类型

在提示词中直接指令独立的或混合的语音、对话、旁白、歌唱、说唱、音乐、环境音和音效。APIXO 的声音开关决定了请求生成的输出是否包含音频。

中英双语人声

Kling Video 2.6 支持涉及多角色的对话场景,包括访谈、剧本对白和简短表演。发布前仍建议检查角色的口型、发音和同步效果。

语义化声音对齐

该模型可以理解文本描述、口语表达和短故事场景,从而将声音与画面事件进行协调。请在提示词中明确描述谁在说话、发生了什么,以及每个声音出现的时间点。

分层音频场景

将人声与环境氛围、特定事件音效相结合,而不是生成单一孤立的声音。这适用于需要将氛围、动作和语音内容融为一体的紧凑场景。

无声工作流选项

通过 APIXO 的图生视频工作流,一张图片用于确定起始构图,第二张可选图片可用于引导期望的结束帧。模型会生成中间的运动过程,而非进行确定性的插值计算。

APIXO 模式

自由生成或固定开场画面构图

文生视频

仅通过必要的提示词生成,无需参考图。APIXO 为此工作流提供了 1:1、9:16 和 16:9 三种宽高比,支持方形、垂直和横向的视听场景。

提示词引导的场景

图生视频

提供一张图片作为起始帧,并可选地提供第二张图片作为结束帧。在此模式下,APIXO 不会转送宽高比选项,因此请根据预期的构图准备源图片。

起始帧 + 可选结束帧
生产规格

通过 APIXO 控制 Kling 2.6

APIXO 接口提供了可选的音频控制参数,无需单独选择质量等级。

1–1,000 个字符

提示词长度

最多 500 个字符

负向提示词

1–2 个图像 URL

图片输入

JPG / PNG / WebP

源格式

0–1

CFG 系数

MP4 视频 URL

APIXO 结果

生产应用

构建音画同步的紧凑故事

广告

带旁白的产品视频

一次性生成包含旁白、环境音和动作音效的产品演示视频。当需要用已批准的产品构图作为镜头开场时,可使用图生视频工作流,然后仔细核对标签、几何形状、语音和宣传语。

社交媒体内容

对话与表演片段

创建访谈、简短的剧本对话、喜剧概念、歌唱或说唱表演。Kling Video 2.6 支持生成对话,但发布前应仔细检查说话人归属、发音、时间点和口型同步的准确性。

故事开发

声音感知场景原型

在 5 秒或 10 秒的场景中制作原型,测试镜头运动、物理动作、对话、环境声和音效如何相互作用。这有助于团队在进行独立的制作或后期制作前,全面评估音视频的整体构想。

视觉转场

图像帧动画

可将一张已批准的图像制成动画,或引导视频片段向可选的结束帧过渡。当转场需要同步的氛围或音效时,添加声音;若用于现有的音频工作流,则可静音生成。

集成说明

与后续 Kling 功能分开的独立文档化控件

APIXO 的限制

01

APIXO 仅提供一个 Kling 2.6 版本,不区分 Standard、Pro、Master 或 Turbo 等质量等级。

02

每次请求都必须提供提示词、选择 5 秒或 10 秒的时长,并明确指定是否需要声音。

03

文生视频接受宽高比选择;图生视频的构图则源自其输入图片。

04

图生视频接受一张起始图像和一张可选的结束帧图像。

05

该路由不提供视频输入、运动控制、扩展、编辑或任意多参考图生成功能。

06

APIXO 支持状态轮询或 webhook 推送;生成时长更长且带音频的视频片段通常需要更多处理时间;对于生产环境的工作负载,建议使用回调方式获取结果。

Kling 2.6 常见问题

APIXO 将此路由映射至快手的 Kling Video 2.6,不提供 Standard、Pro、Master 或 Turbo 质量等级选择器。

生成无声视频的费用为每秒 $0.06:5 秒视频为 $0.30,10 秒视频为 $0.60。启用模型生成音频后,费用为每秒 $0.12:5 秒视频为 $0.60,10 秒视频为 $1.20。

是的。快手官方支持语音、对话、旁白、歌唱和说唱,以及音效和环境音。该模型可生成中文和英文语音,APIXO 通过必需的声音开关和提示词来提供此功能。

不支持。APIXO 未在此接口中提供音频上传或视频输入字段。Kling 2.6 根据提示词生成所需的声音,不接受预录制的语音、音轨、动态片段或源视频。

请检查人物身份、身体结构、手部细节、画面中的文字、物体接触、快速运动、场景转换、对话准确性、角色分配、发音以及音画同步。多角色场景和复杂的音效描述可能需要多次生成才能达到理想效果。

探索其他模型

探索更多 AI 模型,赋能您的创意工作流