いいえ。このAPIXOのページはGoogleのGemini Omni動画ワークフローを対象としており、Geminiのチャット、コーディング、ドキュメント分析、またはエージェントモデルは対象外です。公開されるアウトプットは、選択されたAPIXOモードに応じて、再利用可能なオーディオまたはキャラクターのアセットID、および生成された動画URLとなります。
Gemini Omni
Gemini Omni Flashは、Googleの動画生成・編集用のプレビュー版マルチモーダルモデルです。APIXOは、テキスト、画像、動画、保存済みアセットを参照して、再利用可能な音声アセットおよびキャラクターアセットのワークフローとともに動画生成機能を提供します。統一されたビジュアルとサウンド、現実世界を理解したシーンロジック、そして最大4KまでのAPIXOの出力オプションで動画を生成・変換できます。
入力
テキスト / 画像 / 動画 / 音声アセット
APIXO価格
$0.10 / secondソース動画の編集は操作ごとに課金されます
APIXO 解像度
720p / 1080p / 4K
再生時間
4 / 6 / 8 / 10秒ソース動画入力なし
リリース日
2026年5月30日
Gemini Omniで作成
ワークスペースを読み込み中...
クリエイティブな参照情報を組み合わせて一貫性のある動画を出力
複合参照による生成
APIXOの動画モードは、プロンプトと共に、画像、1つのソース動画、再利用可能なキャラクターID、オーディオIDを受け付けます。これらの参照情報は、単一の動画生成リクエスト内で、外見、動き、シーン構成、音声を制御するために使用できます。
ソース動画の変換
1つの動画を提供し、背景、ビジュアル処理、アクション、選択したシーン要素の変更などの変換を記述します。APIXOはまた、入力の関連部分を選択するための開始位置と終了位置も指定できます。
再利用可能なキャラクターアセット
正確に1枚の画像からキャラクターアセットを作成し、任意で準備したオーディオアセットと関連付けます。返されたキャラクターIDは動画リクエストで再利用でき、APIXOは1回の生成につき最大3つのキャラクターIDをサポートします。
再利用可能なオーディオアセット
APIXOがサポートするベースボイス、オプションの音声詳細、プレビュー用のセリフからオーディオアセットを構築します。生成されたオーディオIDを保存し、後のキャラクターや動画リクエストで使用します。動画モードでは最大3つのオーディオIDを使用できます。
現実世界を認識したシーンロジック
Googleは、Gemini Omni Flashを世界の知識と物理的挙動の理解に重点を置いて位置づけています。これにより、歴史、科学、文化的背景、重力、動き、物質、その他の現実世界の法則に基づいたシーンを構築できます。
映像と音声の連携
Gemini Omni Flashは、付随するオーディオトラックと共に動画を生成し、セリフ、音楽、効果音、カット、画面上のイベントなどのタイミング指示に応えることができます。正確な同期やテキストのタイミングが求められる場合は、プロンプトの精度が重要になります。
APIXOでのGemini Omniの設定
APIXOルートで公開されている、検証済みのアセットモード、参照許容量、出力設定、およびクォータ。
オーディオアセット / キャラクターアセット / 動画
モード
16:9 / 9:16
アスペクト比
最大3つのID
オーディオアセット
最大3つのID
キャラクターアセット
最大1つのURL
ソース動画
7ユニット
参照クォータ
参照ベースの動画制作システムを構築
一貫性のあるプレゼンター動画
承認済みのポートレートから再利用可能なキャラクターを準備し、選択したオーディオアセットとペアリングします。これにより、アプリケーションは同じキャラクターと音声の参照情報を再利用して、様々なシーンでプレゼンター主導の短いキャンペーン動画を生成できます。
マルチモーダルなプロダクトストーリー
商品画像、キャラクターアセット、音声の指示、シーンの概要を組み合わせて、ローンチ用のクリップや広告コンセプトを制作します。横長または縦長のフレームを使い分け、ストアフロント、キャンペーンページ、モバイルチャネル向けのバリエーションを用意できます。
ソース映像のスタイル変更
既存のクリップを送信し、新しい背景、ビジュアルスタイル、オブジェクトの処理、または物語的な効果をリクエストします。開始と終了の制御により、開発者はAPIXOを通じて変換を適用する前に、関連するソース部分を選択できます。
ビジュアル解説とストーリーボード
Gemini Omniの世界知識と物理的推論を活用し、ナレーションと動きが連携した科学、歴史、プロセス、コンセプトの短い解説動画を開発します。事実に関する出力はドラフトとして扱い、公開前に重要な詳細を確認してください。
動画生成の前に再利用可能な入力を準備
APIXOでは、オプションのオーディオとキャラクターの準備は、非同期のGemini Omni動画生成とは分離されています。
オーディオアセットを作成
APIXOがサポートするベースボイスを選択し、アセットに名前を付け、任意で声の方向性やプレビュー用のセリフを指定します。返されたオーディオIDを保存し、後でキャラクターや動画リクエストで直接使用します。
キャラクターアセットを準備
公開されているキャラクター画像を1点、説明的なプロンプトと共にご提出ください。必要に応じて、保存されたオーディオIDも1点指定してください。生成されたキャラクターIDは、今後のGemini Omniの動画タスクで参照できるよう保存されます。
最終的な動画を生成
プロンプトを、適格な画像、オーディオID、キャラクターID、または1つのソース動画と組み合わせます。APIXOがサポートする解像度とフレーミングオプションを選択し、非同期ポーリングまたはWebhook配信によって完成した動画を取得します。
Gemini Omniの利用可能性と制約
運用上の注意点
このページでは、APIXOが現在提供しているGemini Omniの動画、オーディオアセット、キャラクターアセットの各モードについて説明しています。Geminiのチャット、画像生成、ドキュメント分析、またはスタンドアロンの音声APIについては記載していません。
APIXOのブラウザPlaygroundは動画モードに固定されています。オーディオおよびキャラクターアセットの準備はAPI利用向けにドキュメント化されています。
APIXOでは、このルートでの直接のオーディオファイルアップロードはドキュメント化されていません。動画リクエストでは、オーディオアセットモードで作成されたオーディオIDを使用します。
画像、ソース動画、キャラクターの合計クォータは7ユニットです。動画1本は2ユニット、画像またはキャラクターはそれぞれ1ユニットを消費します。
APIXOは、このエンドポイントでGeminiのステートフルなprevious_interaction_idワークフロー、リアルタイムセッション、ドキュメント分析、またはツール使用を公開していません。
英語はアップストリームで完全にサポートされています。他の言語は評価されておらず、予測可能性の低い結果を生成する可能性があります。
よくある質問
APIXOは3つのモードを公開しています。オーディオアセット作成、キャラクターアセット作成、そして非同期の動画生成です。アセットモードは動画リクエスト用に再利用可能なIDを準備するためのものであり、スタンドアロンの音楽生成、音声認識、画像生成、または対話応答のエンドポイントではありません。
ソースビデオ入力がない場合、720pと1080pは生成1秒あたり$0.10、4Kは1秒あたり$0.20の費用がかかります。ソースビデオが1つの場合、APIXOは720pまたは1080pでリクエストごとに$1.20、4Kで$1.80を請求します。
ソースビデオなしでプロンプトや参照画像から動画を生成する場合、再生時間は4、6、8、または10秒をサポートします。ソースビデオのURLが指定された場合、APIXOは再生時間の設定を無視し、選択された入力セグメントとリクエストごとの固定課金を使用します。
APIXOでは、アップロードされた1つのソース動画をプロンプトに基づいて変換する方法をドキュメント化していますが、このエンドポイントでGoogleのステートフルなマルチターンインタラクションパラメータは公開していません。APIXOの各タスクは、ライブスキーマで後に対話状態がドキュメント化されない限り、独立したリクエストとして扱ってください。
他のモデルを見る
次のクリエイティブワークフローのために、さらに多くのAIモデルを発見しましょう