APIXO
オーディオビジュアル動画テキストまたは画像オプションの音声

KuaishouのKling Video 2.6は、短い動画とオプションの同期音声をワンパスで生成します。APIXOを通じて、開発者はテキストまたは1枚の開始画像から作成し、オプションで終了フレームを追加、5秒または10秒の出力を選択し、無音生成または音声、効果音、環境音、音楽付き生成を選ぶことができます。

APIXOワークフロー

テキストから動画 / 画像から動画

音声なしの価格

動画あたり$0.30~5秒(音声なし)

音声あり

動画あたり$0.60~5秒(音声あり)

再生時間

5秒または10秒

リリース日

2025年12月3日

Kling 2.6で作成

ワークスペースを読み込み中...

音声と動きの連携

ビジュアルシーンとそのサウンドトラックを一度に生成

Kling Video 2.6は、無音動画を生成してからアフレコするワークフローを、音声と映像の同時生成に置き換えます。プロンプトでセリフ、ナレーション、歌、音楽、効果音、環境音をシーンと一緒に指定できます。また、別のポストプロダクション音声パイプラインが望ましい場合は、APIXOを通じて音声を無効にすることも可能です。

機能

音声は独立したトラックではなく、シーンに応じて生成

音声と映像の同時生成

Kling Video 2.6は、同一のモデルパス内で映像と音声を生成します。これにより、目に見えるアクション、声のリズム、環境イベント、そして生成されるサウンドトラックのタイミングがより緊密に連携します。

複数の音声タイプ

プロンプト内で、単独または組み合わせたスピーチ、対話、ナレーション、歌、ラップ、音楽、環境音、エフェクトを指示します。APIXOの音声トグルで、リクエストされた出力に生成された音声を含めるかどうかを決定します。

中国語と英語の音声

Kling Video 2.6は、インタビュー、台本のある会話、短いパフォーマンスなど、複数のキャラクターが関わるセリフ主導のシーンをサポートしています。ただし、話者の特定、発音、同期については、公開前にレビューが必要です。

意味的な音声アライメント

モデルは、テキストによる説明、口語表現、短い物語のシナリオを解釈し、映像内のイベントと音声を連携させます。誰が話すか、何が起こるか、各音声がいつ発生するかをプロンプトで明確に記述してください。

レイヤー化された音声シーン

単一の独立した音声を生成するのではなく、環境音やイベント固有のエフェクトと音声を組み合わせます。これにより、雰囲気、アクション、会話コンテンツのすべてが一体となって結果に貢献する、コンパクトなシーンをサポートします。

音声なしワークフローのオプション

APIXOの画像から動画へのワークフローでは、1枚の画像で開始時の構図を設定し、オプションの2枚目の画像で意図する終了フレームを指定できます。モデルは決定論的な補間を行うのではなく、その間の動きを生成します。

APIXOモード

自由に生成、または開始時の構図を固定

テキストから動画

参照画像なしで、必須のプロンプトから生成します。APIXOはこのワークフロー向けに1:1、9:16、16:9のアスペクト比を提供し、正方形、縦長、横長のオーディオビジュアルシーンをサポートします。

プロンプト主導のシーン

画像から動画

1枚の画像を開始フレームとして、オプションで2枚目の画像を終了フレームとして指定します。このモードではAPIXOはアスペクト比の選択を転送しないため、意図した構図に合わせてソース画像を準備してください。

開始フレーム + オプションの終了フレーム
制作仕様

APIXO経由でのKling 2.6の制御

APIXOのルートは、個別の品質レベルセレクターなしで、オプションの音声コントロールを公開します。

1〜1,000文字

プロンプトの長さ

最大500文字

ネガティブプロンプト

1~2個の画像URL

画像入力

JPG / PNG / WebP

ソースフォーマット

0–1

CFGスケール

MP4動画URL

APIXOの結果

本番環境での利用

音声と連携したコンパクトなストーリーを構築

広告

ナレーション付き製品ビデオ

ナレーション、環境音、アクションに応じたエフェクトを含む製品デモを一度に生成します。承認済みの製品構図をショットの起点としたい場合は、画像主導のワークフローを使用し、その後でラベル、形状、音声、主張内容を確認してください。

SNSコンテンツ

対話・パフォーマンスクリップ

インタビュー、短い台本のある会話、コメディの構想、歌、ラップのパフォーマンスを作成します。Kling Video 2.6は生成された対話をサポートしますが、公開前に話者の割り当て、発音、タイミング、リップシンクを確認する必要があります。

ストーリー開発

音声対応シーンプロトタイプ

5秒または10秒のシーン内で、カメラの動き、物理的なアクション、セリフ、環境音、効果音がどのように相互作用するかをプロトタイプします。これにより、チームは個別の制作やポストプロダクションに入る前に、完全なオーディオビジュアルのアイデアを評価できます。

ビジュアルトランジション

指定画像のアニメーション

承認済みの画像を1枚アニメーション化するか、オプションの終了フレームに向かってクリップを誘導します。トランジションに同期した雰囲気やエフェクトが必要な場合は音声を追加し、既存の音声ワークフローがある場合は無音で生成します。

インテグレーションに関する注意点

後のKling機能とは別の文書化されたコントロール

APIXOの制約

01

APIXOでは、Standard、Pro、Master、Turboといった品質階層ではなく、Kling 2.6の単一バリアントを提供します。

02

すべてのリクエストには、プロンプト、5秒または10秒の再生時間、そして音声の有無を明示する値が必要です。

03

テキストから動画への変換ではアスペクト比の選択が可能ですが、画像から動画への変換ではソース画像から構図が導き出されます。

04

画像から動画への変換では、開始画像1枚と、オプションで終了フレーム画像1枚を受け付けます。

05

このルートは、動画入力、モーションコントロール、拡張、編集、または任意の複数リファレンスによる生成には対応していません。

06

APIXOはステータスのポーリングまたはWebhook配信をサポートしています。生成された音声を含む長尺クリップは通常、より多くの処理時間を要するため、本番環境のワークロードにはコールバック配信が推奨されます。

Kling 2.6に関する質問

APIXOはこのルートをKuaishouのKling Video 2.6にマッピングしており、Standard、Pro、Master、Turboといった品質階層のセレクターは提供していません。

音声なしの出力は生成1秒あたり$0.06です。5秒で$0.30、10秒で$0.60となります。モデルによる音声生成を有効にした場合、1秒あたり$0.12となり、それぞれ$0.60、$1.20です。

はい。Kuaishouは公式に、効果音や環境音に加えて、スピーチ、セリフ、ナレーション、歌、ラップをサポートしています。モデルは中国語と英語の音声を生成し、APIXOでは必須の音声切り替え機能とプロンプトを通じてこの機能を提供しています。

いいえ。APIXOは、このルートに対して音声アップロードや動画入力のフィールドを公開していません。Kling 2.6はプロンプトから要求された音声を生成します。事前に録音された音声、サウンドトラック、モーションクリップ、ソース動画は受け付けません。

人物の同一性、身体構造、手、埋め込みテキスト、オブジェクトの接触、素早い動き、トランジション、会話の正確性、話者の割り当て、発音、音声の同期を確認してください。複数のキャラクターが登場するシーンや、複雑な音声指示がある場合は、複数回の生成が必要になることがあります。

他のモデルを見る

次のクリエイティブワークフローのために、さらに多くのAIモデルを発見しましょう