是的。APIXO 将此路由标记并定价为 Kling 3.0 Standard。它与 Kling 3.0 Turbo 和 Video 3.0 Omni 是分开的,因此它们的速度、参考图功能、编辑控件和定价不适用于此。
快手的 Kling Video 3.0 Standard 在 APIXO 平台上整合了文生视频、图像动画和角色动作迁移功能。它将生成片段延长至 15 秒,支持可选的原生音频,并增加了镜头级提示词以实现更强的叙事控制。其运动控制功能可将一张角色图像与一段参考表演视频配对。
APIXO 模式
生成 / 动画 / 迁移
无声视频价格
$0.084/秒不含生成音频的文本和图像模式
生成声音价格
$0.13/秒包含生成音频的文本和图像模式
生成时长
3–15 秒
发布于
2026年2月5日
使用 Kling 3.0 Std 创作
正在加载工作区...
对叙事和连续性的更强控制
更长的场景时长
Kling Video 3.0 将原生生成时长扩展至 15 秒,相比 Kling Video 2.6 的 10 秒上限,为动作、对话、镜头切换和场景发展提供了更多空间。
多镜头叙事
快手设计的 Video 3.0 能够解读多场景和多镜头的指令,包括机位切换、正反打对话、交叉剪辑和画外音。APIXO 为文生和图生视频生成提供了可选的带时间戳的提示词分段功能。
更强的元素一致性
一致性的提升有助于角色、物体、环境和品牌元素在不同帧之间保持更连贯。复杂的运动和更长的序列仍可能引入视觉漂移,需要进行审核。
多语言原生音频
Upstream Video 3.0 支持生成英语、中文、日语、韩语和西班牙语的语音,以及多种英语口音和中国方言。APIXO 通过文本和图像模式的声音控制选项来提供音频生成功能。
更好的文本保留效果
据快手报告,该模型在可见文本(如标牌、字幕、徽标和品牌服装)的保留和生成方面有所改进。但在商业使用前,仍应检查确切的拼写和位置。
照片级真实表演
Video 3.0 提升了富有表现力的角色和动态表演的真实感。详细的提示词可以在单个生成序列中协调主体行为、镜头方向、场景发展和声音。
生成新场景或迁移现有动作
文本和图像生成
通过提示词创建,或为一到两张图像生成 3-15 秒的动画。可选择生成声音或静音输出,并可选择将剪辑划分为带时间的提示词片段,以实现镜头级别的指导。
角色动作控制
将一张角色图像与一段参考动作视频精确结合。选择方向是跟随图像还是视频;时长来自参考剪辑,而声音设置决定是保留其原始音频还是生成新音频。
APIXO 上的 Kling 3.0 Standard
针对生成和动作迁移的工作流特定控件。
1:1 / 9:16 / 16:9
文生视频宽高比
1–2 张图片
图生视频
1 张图像 + 1 段视频
运动控制
最长 30 秒
动作参考
JPG / JPEG / PNG
图片格式
1 个 MP4 URL
APIXO 输出
创作故事、表演和品牌动态影像
多镜头场景原型
通过分段提示词为长视频构建结构,用于设定场景镜头、特写、反应和转场。利用生成结果在制作前测试叙事节奏、镜头切换、对话流畅度和场景逻辑。
参考表演迁移
将短参考视频中的动作应用到角色图像上,用于表演研究、舞蹈测试或风格化动画。根据身体朝向应遵循源图像还是动作素材,选择相应的方向。
品牌音视频营销
创建产品展示、旁白广告和社交媒体短视频,可选择添加原生语音、音乐、环境声和音效。发布前请检查产品几何形状、可见文本、标志、声音用词和同步情况。
多语言对话概念
使用 Kling Video 3.0 的原生语音功能制作对话、采访和跨语言场景的原型。请清晰指定每个发言人、语言、顺序、语气和动作,然后验证归属、发音、口型和连续性。
应用正确的声音和时长规则
APIXO 的限制
文生视频和图生视频接受 3–15 秒的时长设置;运镜模式会忽略该字段。
图生视频接受一张起始图像,并可选一张用于引导结束画面的图像。
运动控制需要一张角色图像和一段时长不超过 30 秒的公开参考视频。
宽高比选择仅通过 APIXO 应用于文生视频。
APIXO 在此不提供单独的音频上传、视频扩展、视频编辑或任意多参考图模式的接口。
生产环境集成可通过轮询或公共 HTTPS 回调来检索异步结果。
Kling 3.0 Standard 相关问题
文生视频和图生视频,在禁用声音时,每生成一秒消耗 $0.084;启用声音时,每秒消耗 $0.13。计费时长为所选的 3 至 15 秒之间的值。
对于运动控制,APIXO 按检测到的参考视频时长计费,每秒 $0.13,最低计费 3 秒。提交的时长字段将被忽略,超过 30 秒的参考视频将被拒绝。
对于文生视频和图生视频,sound: true 表示请求模型生成音频,false 则生成无声输出。在运动控制中,该字段决定是保留参考视频的原始音频,还是请求生成新音频。
检查身份、身体结构、手部、物体接触、嵌入文本、转场逻辑、快速运动、说话者归属、对话准确性、发音和口型同步。更长或多镜头的场景会增加时间和角色出现偏差的可能性。
探索其他模型
探索更多 AI 模型,赋能您的创意工作流