このルートは、テキストから動画、画像から動画、参照から動画、および動画編集を公開しています。これらはそれぞれ異なるプロンプト、メディア、アスペクト比、再生時間、音声、および課金ルールを持つ個別のワークフローです。あるモードで有効なフィールドが、別のモードでも有効であると想定しないでください。
APIXO上のWan 2.7 Videoは、Alibabaの4つの動画ワークフロー(プロンプトによる生成、フレームガイドのアニメーション、マルチモーダル参照生成、指示ベースの動画編集)を一つのオペレーションルートに統合します。広告、物語開発、ローカライズ、ポストプロダクションのパイプライン向けに、モード固有のビジュアル、オーディオ、再生時間、フレーミング制御を用いて720pまたは1080pのクリップを生成できます。
モード
テキスト・画像・参照・編集
APIXO価格
$0.10/秒からバックエンドの秒単位料金による動画ルート
解像度
720p・1080p
再生時間
最大15秒
出力形式
MP4 URL・非同期
ワークスペースを読み込み中...
テキストから動画への変換は、中国語または英語の説明を2〜15秒のクリップに変換します。最大5,000文字のプロンプトで、被写体、アクション、カメラの動き、シーンの進行、およびサウンドの方向性を定義します。
画像から動画への変換では、開始フレーム1枚をアニメーション化する、開始フレームと終了フレームを繋ぐ、またはソース動画を継続してオプションの最終フレームをターゲットとすることが可能です。提供されたビジュアルでシーンが既に確立されている場合、プロンプトは任意です。
画像から動画への変換では、最大5つの画像および動画参照を順序付けて組み合わせることができます。これらを使用して、被写体、外観、動き、またはシーンのコンテキストを確立しますが、すべての参照が固定の出力フレームとして扱われるわけではありません。
参照リクエストでは、公開されているオーディオファイルを個々の参照スロットに関連付けることができます。APIXOは画像スロットを動画スロットの前に配置し、後の参照にオーディオが必要で、前の参照には不要な場合、空のプレースホルダーを受け付けます。
動画編集は、2〜10秒の既存クリップ1つに文章による変換指示を適用し、最大4つの補足画像を組み込むことができます。タイムラインベースの手動編集ではなく、スタイルの変更やガイド付きのビジュアル修正に適しています。
Wan 2.7は、互換性のある生成ワークフローにおいて、同期されたオーディオビジュアル出力とオプションのカスタムオーディオをサポートしています。マルチショット構造はプロンプトの記述を通じて表現できますが、APIXOはこのルートで専用の`shot_type`パラメータを公開していません。
APIXOの運用ルートにおける、モード固有の入力、再生時間制限、および配信ルールです。
720p / 1080p
解像度
16:9 / 9:16 / 1:1 / 4:3 / 3:4
アスペクト比
2〜15秒
テキスト / 画像
2〜15秒・動画の場合は10秒
リファレンス
0秒または2〜10秒
動画編集
ポーリングまたはコールバック
出力形式
企画開発、ストーリーの探求、プリビジュアライゼーションのために、映像の表現方法やショットの説明を短いオーディオビジュアルシーンに変換します。マルチショットプロンプティングにより、コンセプト段階でソース映像を必要とせずに、一連のアクションを伝えることができます。
提供された製品の構図、キービジュアル、イラスト、または開始フレームをアニメーション化します。最終的な構図が重要な場合は、オプションで終了フレームを追加し、公開前に形状の細部、埋め込みテキスト、ブランドの詳細を確認してください。
被写体の画像、パフォーマンス映像、スロットに合わせた音声リファレンスを組み合わせて、繰り返し登場する視覚要素を中心としたキャンペーンシーンを開発します。複雑なアイデンティティ、インタラクション、スピーチ、素早い動きには、複数回の生成と人によるレビューが必要になる場合があります。
短いソースクリップと、変換の概要、そしてオプションのビジュアル参照を送信して、新しい表現、環境、またはアートディレクションを探求します。Wanがオーディオの処理方法を決定するか、元のサウンドトラックを保持するかを選択できます。
テキストから動画および参照から動画の生成にはプロンプトが必要です。APIXOの現在の詳細なルートドキュメントでは、動画編集にも空でないプロンプトが必須となっています。
画像から動画への変換では、1枚または2枚のフレーム画像、あるいは2〜10秒の継続用動画(オプションで最終フレーム画像1枚まで追加可能)を受け付けます。
参照から動画を生成するには、1〜5個の画像と動画の参照を組み合わせる必要があります。動画の参照を追加すると、最大再生時間は10秒に短縮されます。
動画編集には、2〜10秒の公開MP4またはMOVソースクリップが1つだけ必要で、最大4つのオプションの参照画像をサポートします。
画像から動画への変換では、提供されたソース画像に基づいてフレームが構成されるため、アスペクト比は利用できません。他のモードでは、ドキュメントに記載されているアスペクト比のルールが適用されます。
シードを固定すると再現性が向上しますが、同一の出力は保証されません。また、透かしを有効にすると、右下に「AI 生成」という固定テキストが追加されます。
このルートは、テキストから動画、画像から動画、参照から動画、および動画編集を公開しています。これらはそれぞれ異なるプロンプト、メディア、アスペクト比、再生時間、音声、および課金ルールを持つ個別のワークフローです。あるモードで有効なフィールドが、別のモードでも有効であると想定しないでください。
テキストから動画、画像から動画、および動画編集は、720pで請求対象秒あたり$0.10、1080pで$0.15の費用がかかります。参照から動画への変換は、720pで秒あたり$0.15、1080pで秒あたり$0.24の費用がかかります。
APIXOの動画編集では、上限設定された入力再生時間と、リクエストされた出力再生時間の合計に対して課金されます。duration=0の場合、出力はソースの再生時間に従い、課金対象秒数は上限設定された入力再生時間の2倍となります。2〜10秒の出力リクエストの場合、APIXOはその時間を上限設定された入力再生時間に加算します。
audio_settingはvideo-editにのみ属します。autoは、プロンプトの音声指示が音声の再生成を必要とするかどうかをモデルが判断できるようにし、それ以外の場合はソース音声を保持することがあります。originは入力音声の保持を強制し、再生成をスキップします。
APIXOは、audio_urlsを参照スロットに順番にマッピングします。まずすべての画像参照が、次にすべての動画参照が配置されます。後の音声をずらさずにスロットを1つスキップするには、空の文字列を使用します。空でない各エントリは、関連する参照の音声ガイダンスとして機能します。
次のクリエイティブワークフローのために、さらに多くのAIモデルを発見しましょう