このページは、2025年8月19日に技術レポート、コード、モデルの重みと共に公開された、MeiGen-AIによるオリジナルのInfiniteTalkリサーチリリースについて説明しています。LongCat Video Avatar、コミュニティのチェックポイント、または関連のないアバターシステムについては説明していません。
InfiniteTalk
InfiniteTalkは、MeiGen-AIが開発した音声駆動の人物動画モデルで、口の動きだけでなく、顔の表情、頭の動き、体の姿勢を音声と同期させます。APIXOは、ポートレートと音声に特化したワークフローを提供し、オプションのマスク、最大10分間の駆動音声、480pまたは720pの出力、非同期配信に対応しています。
APIXOの入力
ポートレート + 音声
APIXO価格
1秒あたり$0.03から480p、最低5秒
APIXO 解像度
480p / 720p
音声の制限
最大600秒
リリース日
2025年8月19日
InfiniteTalkで作成
ワークスペースを読み込み中...
音声がより幅広い人間のパフォーマンスを駆動
音声に同期した動き
InfiniteTalkは、駆動音声を使用して口の動きを表情、頭の動き、体の姿勢と連携させます。リップシンク(唇の同期)は主要な目標ですが、その精度は話す速度、ポーズ、ソースの品質によって変動する可能性があります。
長時間シーケンスの連続性
InfiniteTalkの上流フレームワークは、生成されたセグメント間の時間的コンテキストを利用して、より長い音声駆動シーケンスをサポートします。APIXOは最大600秒の駆動音声を受け付けますが、長い出力の場合は、アイデンティティのずれやトランジションの一貫性を確認する必要があります。
ポートレートからパフォーマンスへ
APIXOの実装は、テキストのみのキャラクター説明ではなく、1枚のポートレート画像から始まります。このソース画像によって、音声駆動の動きが合成される前に、被写体の見た目、服装、構図、背景が確立されます。
音声と歌のパフォーマンス
完成したスピーチ、セリフ、ナレーション、または歌の音声でポートレート画像を動かします。声のペース、感情、発音、表現は、このエンドポイント内のテキスト読み上げシステムではなく、提供された録音から生成されます。
長時間の音声入力
APIXOは、最大600秒までの音声ファイル1件を受け付けます。これにより、一般的な短いアバタークリップよりも長い素材にも対応できますが、再生時間が長くなるにつれて処理時間と一貫性の要求も高まります。
再現可能な反復処理
480pまたは720pの出力を選択し、任意でAPIXOのシード値を指定します。シード値を固定することで、制御された実験が可能になりますが、入力の変更やプロバイダーの改訂に対して同一の結果を保証するものではありません。
APIXO経由のInfiniteTalkコントロール
ポートレートと音声の専用ワークフローの公開制限。
ポートレート画像1枚 + オプションのマスク
画像入力
音声URL 1件
音声数
MP3 / WAV / M4A
音声フォーマット
128 MB
音声サイズ制限
5秒
最低請求額
非同期 / コールバック
出力形式
用意した音声から話し言葉のコンテンツを作成
プレゼンター・スポークスパーソン動画
用意したポートレートと、録音または合成された音声を組み合わせて、プレゼンター風のコンテンツを作成します。このエンドポイントは、提供されたパフォーマンス音声をアニメーション化するものであり、スクリプトを作成したり、テキストから音声を生成したりするものではありません。
ローカライズされたマーケティング版
承認されたポートレートを、地域ごとのキャンペーン用に別途制作された音声トラックと再利用します。InfiniteTalkは特定の言語ではなく音響パフォーマンスに反応しますが、録音ごとに発音と同期を確認する必要があります。
レッスンとトレーニングモジュール
ナレーションを、インストラクター、ガイド、またはコースアバターの動画(480pまたは720p)に変換します。APIXOの10分間の音声制限は長めの解説に対応しており、複雑なモジュールは品質管理を容易にするために短いセグメントに分割することも可能です。
キャラクターのスピーチと歌
セリフ、ナレーション、または歌の音声から、適切なキャラクターのポートレートをアニメーション化します。極端に様式化された、人間でない、全身、または複数人のソースは、APIXOが保証するものではなく、本番フォーマットに採用する前にテストする必要があります。
ポートレート、音声、配信パスを準備する
クリーンなソース素材を使用することで、回避可能な同期やアイデンティティの問題を減らせます。
鮮明なポートレートを準備する
顔がはっきりと見え、遮蔽物が少なく、十分な画質の被写体を1つ選択してください。APIXOはアスペクト比やカメラの制御を公開していないため、意図したフレーミングと背景をソース画像に含めてください。
完成した音声ファイルをアップロード
128MBおよび600秒の制限内で、パブリックなMP3、WAV、またはM4AのURLを1つ提供してください。トラックを送信する前に、文字起こし、翻訳、音声生成、クリーンアップ、タイミング調整を完了させてください。
モーションの生成と確認
480pまたは720pを選択し、非同期タスクを送信後、ポーリングまたはコールバックで結果を取得します。公開前に、口、歯、目、手、ポーズ、アイデンティティ、セグメントの遷移を確認してください。
APIXOが公開する機能について
重要な制約
APIXOは、ポートレート画像と駆動用の音声ファイルを必要とする、画像から動画へのモードを1つ提供します。
APIXOが公開しているリクエストスキーマでは、プロンプトは必須とされています。すべての生成リクエストで、明確な動きの指示を送信してください。
課金は、検出された音声の長さ、または5秒間のいずれか長い方に基づいて行われます。
音声が長くなるほど処理時間が増加します。長時間の本番タスクには、コールバックによる配信が推奨されます。
APIXOは、動画の入力、アスペクト比、フレームレート、または出力フォーマットの制御を公開していません。
ポートレートと音声は、必要な権利、同意、および許可を得ている場合にのみ使用してください。
InfiniteTalkに関する質問
公開されているinfinitetalkのスキーマでは利用できません。元となる研究では音声駆動のvideo-to-videoダビングをサポートしていますが、APIXOはポートレートと音声によるimage-to-videoのワークフローを公開しており、ソースビデオのフィールドはありません。
いいえ。APIXOではアップロードされた音声ファイルが必要で、その録音が結果のパフォーマンスを駆動します。InfiniteTalkを呼び出す前に、別の録音システムやテキスト読み上げシステムを使用して、話したり歌ったりする音声を作成してください。
アップロードされた音声がパフォーマンスを駆動し、APIXOは課金のためにその再生時間を最大600秒まで検出します。別途の再生時間制御はありません。最終的な動画の長さを検証する際は、処理やエンコードによる差異が生じる可能性を考慮してください。
顔が隠れている、極端なポーズ、早口、不明瞭な音声、顔の近くに見える手、複数の人物、低品質のポートレートなどは、同期エラーや視覚的なずれを増加させる可能性があります。長い出力は、全体を通してアイデンティティと時間的な一貫性を確認する必要があります。
他のモデルを見る
次のクリエイティブワークフローのために、さらに多くのAIモデルを発見しましょう