はい。APIXOでは、このルートをKling 3.0 Standardとして表示し、価格設定しています。これはKling 3.0 TurboおよびVideo 3.0 Omniとは別のものであるため、それらの速度、リファレンス機能、編集コントロール、価格設定はここには適用されません。
KuaishouのKling Video 3.0 Standardは、APIXO上でテキストから動画生成、画像アニメーション、キャラクターモーション転写を統合します。生成されるクリップは最大15秒に延長され、ネイティブ音声(任意)をサポートし、ショットレベルのプロンプトで物語のコントロールを強化します。モーションコントロールでは、1枚のキャラクター画像と1本の参照パフォーマンス動画をペアで使用します。
APIXOモード
生成 / アニメーション化 / 転送
音声なしの価格
$0.084/秒音声生成を伴わないテキスト・画像モード
生成音声の価格
$0.13/秒音声生成を伴うテキスト・画像モード
生成時間
3~15秒
リリース日
2026年2月5日
Kling 3.0 Stdで作成
ワークスペースを読み込み中...
物語と連続性のより高度な制御
シーン再生時間の延長
Kling Video 3.0は、ネイティブ生成を15秒まで延長し、Kling Video 2.6の最大10秒よりもアクション、対話、カメラの切り替え、シーン展開の自由度を高めました。
マルチショットのストーリーテリング
Kuaishouは、Video 3.0をマルチシーン・マルチショットの指示を解釈できるように設計しました。これには、カメラアングルの変更、ショット・リバースショットによる対話、クロスカッティング、ナレーションなどが含まれます。APIXOは、テキストおよび画像主導の生成向けに、時間指定されたプロンプトセグメント(任意)を公開しています。
より強力な要素の一貫性
一貫性の向上により、キャラクター、オブジェクト、環境、ブランド要素などをフレーム間でより整合性のある状態に保つことができます。ただし、複雑な動きや長いシーケンスでは、依然として映像にズレが生じる可能性があるため、レビューが必要です。
多言語ネイティブ音声
Upstream Video 3.0は、英語、中国語、日本語、韓国語、スペイン語での音声生成に対応しており、さらに英語のアクセントや中国語の方言もサポートしています。APIXOでは、テキストモードおよび画像モードのサウンドコントロールを通じて、生成された音声を利用できます。
テキストの再現性の向上
Kuaishouは、看板、キャプション、ロゴ、ブランドロゴ入りの衣服など、視認できるテキストの保持と生成が改善されたと報告しています。ただし、商用利用の前に、正確なスペルと配置を確認する必要があります。
フォトリアルなパフォーマンス
Video 3.0は、表現力豊かなキャラクターとダイナミックなパフォーマンスのために、フォトリアルな出力を向上させます。詳細なプロンプトを使用することで、1つの生成シーケンス内で被写体の振る舞い、カメラの指示、シーンの進行、音声を調整できます。
新しいシーンを生成するか、既存のモーションを転送
テキストと画像の生成
プロンプトから作成するか、1〜2枚の画像を3〜15秒でアニメーション化します。生成された音声または無音出力を選択し、オプションでクリップを時間指定のプロンプトセグメントに分割してショットレベルの指示を与えることもできます。
キャラクターモーションコントロール
キャラクター画像1枚と参照モーション動画1本を正確に組み合わせてください。向きを画像と動画のどちらに従うかを選択します。再生時間は参照クリップから取得され、音声設定によって元の音声が保持されるかどうかが決まります。
APIXO上のKling 3.0 Standard
生成とモーショントランスファーのためのワークフロー特化型コントロール。
1:1 / 9:16 / 16:9
テキストから動画のアスペクト比
画像1~2枚
画像から動画
画像1枚 + 動画1本
モーション制御
最大30秒
モーション参照
JPG / JPEG / PNG
画像フォーマット
MP4のURL 1件
APIXO 出力
ストーリー、パフォーマンス、ブランドのモーションを開発
マルチショットシーンのプロトタイプ
エスタブリッシングショット、クローズアップ、リアクション、トランジションなど、時間指定されたプロンプトセグメントを用いて、より長い生成クリップを構成します。この結果を使用して、制作前に物語のリズム、カメラの切り替え、対話の流れ、シーンの論理性をテストできます。
参照パフォーマンスの転写
短い参照動画の動きをキャラクター画像に適用し、パフォーマンスの研究、振り付けのテスト、または様式化されたアニメーションに活用します。体の向きをソース画像とモーション映像のどちらに従わせるかに応じて、向きを選択してください。
ブランドのオーディオビジュアルキャンペーン
製品のショーケース、ナレーション付き広告、短いソーシャルキャンペーンを、オプションのネイティブスピーチ、音楽、環境音、エフェクト付きで作成します。公開前に、製品の形状、表示されるテキスト、ロゴ、セリフ、同期などを確認してください。
多言語会話のコンセプト作成
Kling Video 3.0のネイティブ音声機能を使用して、会話、インタビュー、多言語シーンのプロトタイプを作成できます。各話者、言語、順序、トーン、アクションを明確に指定し、発話の割り当て、発音、口の動き、連続性を確認してください。
正しい音声と再生時間のルールを適用する
APIXOの制約
テキストから動画と画像から動画は3~15秒の再生時間を受け付けます。モーションコントロールはそのフィールドを無視します。
画像から動画生成では、開始画像1枚と、任意で終了フレームをガイドするための2枚目の画像を使用できます。
モーションコントロールには、1枚のキャラクター画像と、30秒以内の公開されている参照動画が1本必要です。
アスペクト比の選択は、APIXOを介したテキストから動画への変換にのみ適用されます。
このモードでは、APIXOはアップロードされた音声、動画の拡張、動画編集、または任意のマルチ参照モードを個別に提供しません。
本番環境への統合では、ポーリングまたは公開HTTPSコールバックを介して非同期結果を取得できます。
Kling 3.0 Standardに関する質問
テキストから動画および画像から動画の料金は、音声が無効の場合は生成される動画1秒あたり$0.084クレジット、音声が有効の場合は1秒あたり$0.13クレジットです。課金対象の再生時間は、3秒から15秒の間で選択された値となります。
APIXOのモーションコントロールは、検出された参照動画1秒あたり$0.13クレジットが課金され、最低3秒分からの請求となります。送信された再生時間(duration)フィールドは無視され、30秒を超える参照動画は拒否されます。
テキストから動画および画像から動画の場合、sound: trueはモデルによる音声生成を要求し、falseは音声なしの出力を生成します。モーションコントロールでは、同じフィールドが、新たに生成された音声を要求するのではなく、参照動画の元の音声を保持するかどうかを決定します。
アイデンティティ、身体構造、手、物体との接触、埋め込みテキスト、トランジションの論理、素早い動き、話者の特定、セリフの正確性、発音、リップシンクを確認してください。シーンが長い、またはマルチショットであるほど、時間経過やキャラクターの一貫性が崩れる可能性が高まります。
他のモデルを見る
次のクリエイティブワークフローのために、さらに多くのAIモデルを発見しましょう