はい。このモデルはAPIXOの非同期タスクエンドポイントで利用可能であり、カタログ内の他のすべてのモデルと同じAPIキーで呼び出すことができます。また、このページのPlaygroundでも生成が可能です。
MiniMax H3は、テキスト、画像、動画、音声のコンテキストを1つの生成ワークフローに統合する汎用マルチモーダル動画モデルです。ネイティブステレオサウンド付きで最大2K解像度・15秒の動画を生成し、さらに最初と最後のフレーム制御、複合メディア参照、モーショントランスファー、マルチショットストーリーテリング、指示に基づく動画編集にも対応しています。
入力
テキスト / 画像 / 動画 / 音声
APIXO価格
$0.09–$0.13 / 秒
解像度
768p / 2K
再生時間
5~15秒
オーディオ
ネイティブステレオサウンド
ワークスペースを読み込み中...
1つのリクエストで、テキストによる指示と画像、動画、音声の参照を組み合わせます。各ソースに、外見、モーション、カメラ、音声、リズム、環境、スタイルなどの役割を割り当ててください。
開始フレーム、終了フレーム、またはその両方を定義して、変形、トランジション、製品の公開、ストーリーボードのビートをガイドし、より明確な視覚的軌道を維持します。
リファレンス画像、動画、音声を組み合わせて使用し、キャラクターのアイデンティティ、製品の手がかり、動き、カメラ言語、ボーカルパフォーマンス、音楽、または雰囲気を伝えます。
生成後に個別のオーディオトラックを組み立てるのではなく、動画と同時に音声、効果音、環境音、音楽をネイティブのステレオ音声として生成します。
1つのプロンプト主導または参照ガイドのワークフローから、連携したショットチェンジ、シーンの進行、アクションの連続性、視聴覚的なペース配分を持つ短いシーケンスを構築します。
自然言語による指示を通じて既存のビジュアル素材を変換したり、アイデンティティ、構図、オクルージョン、ソースディテールの忠実度を確認しながら動画リファレンスから動きを転写したりします。
製品画像、テキストによる指示、モーションの参照、サウンドの意図を組み合わせてキャンペーンコンセプトを開発します。生成された商用アセットを承認する前に、ラベル、ロゴ、素材、寸法、製品の形状を確認してください。
視覚的な参照で繰り返し登場する被写体を設定し、追加のメディアで動き、カメラワーク、音声、シーンの文脈を誘導します。完成した結果全体を通して、アイデンティティの連続性、身体構造、表情、パフォーマンスのタイミングを評価してください。
トリートメント(構成案)を、アクション、カメラ言語、雰囲気、オーディオビジュアルのペースを組み合わせた短いシーンに変換します。実際の制作や詳細なポストプロダクションに着手する前に、生成された映像を使用してアイデアを評価します。
自然言語の指示と任意の参照を用いて、スタイル、環境、被写体、シーンの変更を試します。時間的な境界、オクルージョン、意図しない変更、ソースディテールの維持をフレームごとに検証してください。
稼働中のAPIXOデプロイメントで確認済み。
テキスト / 画像 / 動画 / 音声
入力
T2V / I2V / リファレンス
ワークフロー
768p / 2K
解像度
5~15秒
再生時間
ネイティブステレオ
オーディオ
6つのアスペクト比 + アダプティブ
フレーミング
MiniMax H3はAPIXOの非同期タスクエンドポイントで実行されます。generateTaskにリクエストを送信してstatusTaskをポーリングするか、Webhook配信用にコールバックURLを指定してください。
テキストから動画、画像から動画、リファレンス動画の3つのモードが利用可能です。画像から動画モードは、最初のフレームとオプションの最後のフレームとして1〜2枚の画像を使用します。リファレンス動画モードは、最低1つの画像または動画の参照が必要です。
出力は768pまたは2Kの解像度で、長さは5〜15秒(整数秒のみ)です。解像度によって1秒あたりのレートが決まります。プロンプトは4,000文字までです。参照動画と参照音声は、それぞれ最大3ファイル、1ファイルあたり2〜15秒、合計で15秒までに制限されています。
「MiniMax H3」はAPIXOのモデルIDです。Hailuo 2.3またはHailuo 2.3 Fastのパラメータ値、品質ティア、課金体系は引き継がないでください。これらは異なる契約を持つ別のルートです。
リファレンスは生成の指針となりますが、正確なアイデンティティ、タイポグラフィ、ロゴ、素材、または製品の形状を保証するものではありません。
リリース前に、人体の構造、手、オブジェクトの接触、素早い動き、オクルージョン、カメラのトランジション、スピーチ、視聴覚の同期を確認してください。
はい。このモデルはAPIXOの非同期タスクエンドポイントで利用可能であり、カタログ内の他のすべてのモデルと同じAPIキーで呼び出すことができます。また、このページのPlaygroundでも生成が可能です。
テキストから動画、画像から動画、リファレンス動画の各モードに対応。リファレンス動画モードでは、創造的なコンテキストとして最大で画像9枚、動画3本、音声ファイル3つを組み合わせ可能。ただし、音声のみを単独で指定することはできません。
768pまたは2Kの解像度で、5〜15秒の動画を整数秒単位で出力します。2Kはデフォルトであり、このルートで提供される最高ティアです。768pはより低い秒単位のレートで課金されます。テキストから動画および参照から動画の場合、アスペクト比は21:9、16:9、4:3、1:1、3:4、9:16に設定可能です。画像から動画の場合、フレーミングは提供された最初のフレームに基づきます。
出力動画は、すべてのモードで選択した解像度に応じたレートで秒単位で課金されます(768pは2Kよりも1秒あたりの料金が安価です)。参照から動画の場合、参照動画の実際の秒数が同じ秒単位レートで課金され、最初の5枚の参照画像は無料で、それ以降は画像ごとに追加料金が発生します。参照音声は課金されません。現在のレートについては、料金タブをご覧ください。
はい。音声は映像と同時にネイティブステレオとして生成され、会話、効果音、環境音、音楽が別々のトラックとしてではなく、統合的にモデリングされます。
いいえ。複合メディアリファレンスは創造的な意図を伝えるものですが、正確な人物・キャラクターのアイデンティティ、動き、音声、製品の構造、またはフレーム単位での再現を保証するものではありません。本番環境で使用する際は、映像と音声のレビューが必要です。
次のクリエイティブワークフローのために、さらに多くのAIモデルを発見しましょう