動画生成マルチモーダルリファレンス生成された音声

Seedance 2.0 Fastは、ByteDance Seedance 2.0向けのAPIXOの速度重視ルートであり、別途文書化されたByteDanceの上位モデルバリアントではありません。プロンプトによる生成、最初と最後のフレームからのアニメーション、マルチモーダルリファレンスワークフローを公開しており、オプションで音声生成とウェブ検索、4〜15秒の出力、480pまたは720pでの提供が可能です。

APIXOモード

3つのワークフロー

APIXO価格

$0.044~$0.16 / 秒

解像度

480p / 720p

再生時間

4~15秒

Seedance 2.0 ローンチ

2026年2月12日

Seedance 2.0 Fastで作成

ワークスペースを読み込み中...

APIXOによるルーティング

専用のFastルートを通じて、焦点を絞ったSeedance 2.0のワークフローにアクセスします

ByteDanceはSeedance 2.0を統合されたマルチモーダル音声ビデオモデルとして公式に文書化していますが、Seedance 2.0 Fastモデルを別途公開してはいません。APIXOの「Fast」という名称は、このルートと、その検証済みの制御、価格設定、および配信動作を識別するためのものであり、アーキテクチャの変種や定量化された速度向上を保証するものではありません。

機能

プロンプト、キーフレーム、複合リファレンスでモーションを指示

マルチモーダル条件付け

テキストと画像、動画、音声のリファレンスを組み合わせることで、生成AIは視覚的な構図、動き、カメラワーク、エフェクト、または音関連のコンテキストから情報を引き出すことができます。

キーフレーム制約付きモーション

提供された最初のフレームにモーションを固定するか、最初と最後のフレームを明示的に指定して、それらの間のトランジションを指示します。これらは汎用的な参照画像としては扱われません。

リファレンス主導の一貫性

認識可能な被写体、環境、視覚的処理、モーションの手がかりを新しいシーケンスに引き継ぎます。忠実度は生成AIに依存するため、参照間に矛盾がある場合は低下する可能性があります。

オーディオビジュアル統合出力

動画と同時に音声を生成することで、シーンのタイミングや視覚的なアクションに合わせて音響イベントを発生させることができます。APIXOでは、サウンドコントロールを通じて無音での出力も可能です。

複雑な動きの処理

Seedance 2.0は、Seedance 1.5 Proと比較して、複数の被写体がインタラクションするシーンや、動きの激しいシーンでの物理的な正確性と安定性が向上しています。

カメラとストーリーの制御

選択された出力再生時間内で、プロンプトとリファレンス映像を解釈し、カメラの動き、照明、パフォーマンス、トランジション、マルチショットの物語構造を生成します。

APIXO設定

モード固有の生成制限

Seedance 2.0 Fastルートで利用可能な検証済みコントロール。

3

生成モード

4~15秒

再生時間

6つのアスペクト比 + 自動

アスペクト比

1~9枚

Omni 画像入力

1~3本の動画

動画リファレンス

1~3つの音声ファイル

音声リファレンス

本番環境での利用

さまざまなレベルのクリエイティブディレクションから短い動画を構築します

迅速なコンセプト作成

プロンプトによるシーン探索

文章の概要を、横長、縦長、正方形、またはウルトラワイドの短いコンセプト動画に変換し、オプションで音声を追加します。このワークフローは、ソースメディアを必要とせず、キャンペーンの初期開発、絵コンテの代替、ビジュアルピッチ、ソーシャルコンテンツのアイデア出しに適しています。

制御されたアニメーション

承認済みキーフレームをアニメーション化

静止画に動きを与えたり、指定した開始フレームと終了フレームの間を繋いだりします。製品の発表、ストーリーボードのトランジション、タイトルシーケンス、キャラクターの重要なシーン、および幅広い参照の混合よりも始点と終点が重要なデザイン主導のクリップに最適です。

ブランドプロダクション

キャンペーン参照を組み合わせる

広告やローンチコンセプトを制作するために、製品ショット、環境画像、モーション映像、およびオプションの音声キューを提供します。本番で使用する前に、ブランディング、アイデンティティ、オブジェクトのジオメトリ、接触、リファレンスの矛盾点を確認してください。

モーション適応

動きとリズムの変換

参照する映像や音声を利用して、新しく生成するクリップのカメラワーク、アクションのペース、パフォーマンスのリズム、または視覚効果を調整します。このルートは、元の動画を直接編集したり、音声を完全に保持したりすることを保証するものではありません。

参照の操作

ソースメディアを準備する前にワークフローを選択

APIXOの各モードは異なるリファレンス構造を受け入れ、サポートされていない組み合わせは拒否します。

テキストまたはキーフレームから開始

プロンプトでシーン全体を定義したい場合は「テキストからの動画生成」を使用します。1枚の画像で開始シーンを確立したい場合や、順序付けられた2枚の画像で生成される動きの始点と終点を固定したい場合は「最初と最後のフレーム指定」を選択してください。

Omniリファレンスの組み立て

より広範な条件付けのために、最大9枚の画像、3本の動画、3つの音声ファイルを組み合わせることができます。各動画または音声ファイルは2〜15秒である必要があり、参照メディアのカテゴリごとに合計15秒を超えることはできません。

出力と配信の設定

480pまたは720pの解像度、4秒から15秒までの整数で指定する再生時間、フレーミング、音声生成の有無、およびオプションのWebコンテキストを選択します。非同期でリクエストを送信し、ポーリングまたはコールバックを通じて生成されたMP4ファイルを取得します。

注記 & FAQ

ルートの識別、課金、およびリファレンスの制約

実装に関する注記

01

ByteDanceはSeedance 2.0を公開していますが、独立したアップストリームのSeedance 2.0 FastモデルやモデルIDは公に特定されていません。

02

「最初と最後のフレーム」は1枚または2枚の画像を受け付けます。1枚目は開始フレーム、任意で設定する2枚目は終了フレームです。

03

オムニリファレンスは混合メディアを受け付けますが、音声のみのリクエストは拒否されます。少なくとも1つの画像または動画リファレンスが必要です。

04

APIXOでは、デフォルトで音声生成が有効になっており、無音での出力も可能です。アップロードされた音声は、ソース音声の保持を目的とするものではなく、コンディショニングとして機能します。

05

APIXOのドキュメントによると、3つのワークフローすべての標準的な処理時間は約3〜6分です。この見積もりは可変であり、レイテンシを保証するものではありません。

06

結果のURLは一時的なものである可能性があるため、完成した動画は速やかにダウンロードして保存する必要があります。

よくある質問

Fastは、独自の公開モード、解像度、リファレンス制限、価格設定を持つAPIXO独自のルートです。公開されているByteDanceの資料では、独立したFastアーキテクチャは特定されておらず、速度や品質の違いも数値で示されていないため、これらの比較を前提とすべきではありません。

テキストから動画、最初と最後のフレーム、および動画入力なしのオムニリファレンスは、480pで出力1秒あたり$0.08、720pで出力1秒あたり$0.16のコストがかかります。画像と音声の参照は課金対象の秒数には加算されません。

480pの場合、レートは1秒あたり$0.044、720pの場合は$0.0953です。APIXOでは、このレートが生成される動画の再生時間と、参照するすべての動画の合計再生時間の両方に適用されます。

APIXOは、ソース音声の保持についてドキュメントで言及していません。動画ファイルと音声ファイルは生成のコンテキストを提供し、音声設定は出力にモデルが生成した音声を含めるかどうかを制御します。

人体の構造、手、アイデンティティ、オブジェクトの接触、素早い動き、埋め込まれたテキスト、リファレンスの忠実度、トランジション、対話の解釈、発音、リップシンクを検査してください。複雑または矛盾するリファレンスは、単純化して再生成する必要がある場合があります。

他のモデルを見る

次のクリエイティブワークフローのために、さらに多くのAIモデルを発見しましょう