Sì. Il modello è attivo sull'endpoint per task asincroni di APIXO e può essere richiamato con la stessa chiave API di ogni altro modello nel catalogo. La generazione è disponibile anche nel Playground su questa pagina.
MiniMax H3 è un modello video multimodale per uso generale che combina contesto testuale, di immagini, video e audio in un unico workflow di generazione. Crea video fino a 2K e 15 secondi con audio stereo nativo, supportando al contempo il controllo del primo e dell'ultimo fotogramma, riferimenti multimediali, trasferimento del movimento, storytelling multi-inquadratura e video editing guidato da istruzioni.
Input
Testo / Immagine / Video / Audio
Prezzo APIXO
$0.09–$0.13 / al secondo
Risoluzione
768P / 2K
Durata
5-15 secondi
Audio
Suono stereo nativo
Caricamento dell'area di lavoro...
Combina direttive scritte con riferimenti di immagini, video e audio in un'unica richiesta. Assegna a ogni fonte un ruolo come aspetto, movimento, telecamera, voce, ritmo, ambiente o stile.
Definisci un fotogramma di apertura, uno di chiusura o entrambi per guidare trasformazioni, transizioni, presentazioni di prodotti e punti chiave dello storyboard, preservando una traiettoria visiva più chiara.
Usa insieme immagini, video e audio di riferimento per comunicare l'identità del personaggio, spunti sul prodotto, movimento, linguaggio della camera, performance vocale, musica o atmosfera.
Genera voce, effetti sonori, audio d'ambiente e musica insieme al video come audio stereo nativo, invece di assemblare tracce audio isolate dopo la generazione.
Crea brevi sequenze con cambi di inquadratura coordinati, progressione della scena, continuità dell'azione e ritmo audiovisivo da un unico flusso di lavoro guidato da prompt o riferimenti.
Trasforma materiale visivo esistente tramite istruzioni in linguaggio naturale o trasferisci il movimento da riferimenti video, verificando l'identità, la composizione, l'occlusione e la fedeltà dei dettagli della fonte.
Combina immagini di prodotto, direttive scritte, riferimenti di movimento e intenti sonori per sviluppare concept di campagne. Esamina etichette, loghi, materiali, dimensioni e geometria del prodotto prima di approvare gli asset commerciali generati.
Definisci un soggetto ricorrente con riferimenti visivi, poi guida il movimento, il comportamento della camera, la voce o il contesto della scena tramite media aggiuntivi. Valuta la continuità dell'identità, l'anatomia, l'espressione e la tempistica della performance nel risultato completo.
Traduci un trattamento in brevi scene che combinano azione, linguaggio della camera, atmosfera e ritmo audiovisivo. Usa il girato generato per valutare le idee prima di impegnarti nella produzione fisica o in una post-produzione dettagliata.
Esplora modifiche di stile, ambiente, soggetto o scena tramite istruzioni in linguaggio naturale e riferimenti opzionali. Ispeziona fotogramma per fotogramma i confini temporali, l'occlusione, le modifiche non intenzionali e la conservazione dei dettagli della fonte.
Confermato rispetto all'implementazione live di APIXO.
Testo / Immagine / Video / Audio
Input
T2V / I2V / Riferimento
Flussi di lavoro
768P / 2K
Risoluzione
5–15 secondi
Durata
Stereo nativo
Audio
6 rapporti + adattivo
Inquadratura
MiniMax H3 viene eseguito sull'endpoint per task asincroni di APIXO. Inviare a generateTask e interrogare statusTask, oppure fornire un URL di callback per la consegna tramite webhook.
Sono disponibili tre modalità: testo a video, immagine a video e video da riferimento. La modalità immagine a video accetta 1-2 immagini come fotogramma iniziale e, opzionalmente, finale; la modalità video da riferimento richiede almeno un'immagine o un video di riferimento.
L'output è a 768p o 2K con durata da 5 a 15 secondi (solo secondi interi). La risoluzione determina la tariffa al secondo. I prompt sono limitati a 4.000 caratteri. I video e gli audio di riferimento sono limitati a 3 file ciascuno, da 2 a 15 secondi per file e 15 secondi in totale.
“MiniMax H3” è l'ID del modello APIXO. Non trasferire i valori dei parametri, i livelli di qualità o il comportamento di fatturazione da Hailuo 2.3 o Hailuo 2.3 Fast: si tratta di route separate con contratti diversi.
I riferimenti guidano la generazione ma non garantiscono l'esatta identità, tipografia, loghi, materiali o geometria del prodotto.
Rivedere anatomia, mani, contatto con oggetti, movimento rapido, occlusione, transizioni di camera, parlato e sincronizzazione audiovisiva prima del rilascio.
Sì. Il modello è attivo sull'endpoint per task asincroni di APIXO e può essere richiamato con la stessa chiave API di ogni altro modello nel catalogo. La generazione è disponibile anche nel Playground su questa pagina.
Testo a video, immagine a video e video da riferimento. La modalità video da riferimento accetta fino a 9 immagini, 3 video e 3 file audio come contesto creativo combinato; l'audio non può essere fornito da solo.
Output a 768p o 2K con durata da 5 a 15 secondi (solo secondi interi). 2K è l'impostazione predefinita e il livello più alto esposto dall'endpoint; 768p viene fatturato a una tariffa al secondo inferiore. Il rapporto d'aspetto può essere impostato su 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16 per le modalità testo a video e riferimento a video; la modalità immagine a video acquisisce l'inquadratura dal primo fotogramma fornito.
Il video di output è fatturato al secondo in ogni modalità, alla tariffa corrispondente alla risoluzione scelta: 768p è più economico al secondo rispetto a 2K. Nella modalità riferimento a video, i secondi effettivi dei video di riferimento sono fatturati alla stessa tariffa al secondo, e le prime 5 immagini di riferimento sono gratuite, mentre ogni immagine aggiuntiva ha un costo separato. L'audio di riferimento non viene fatturato. Consulta la scheda dei prezzi per le tariffe attuali.
Sì. L'audio viene prodotto nello stesso passaggio dell'immagine come stereo nativo, con parlato, effetti sonori, ambiente e musica modellati congiuntamente anziché come tracce separate.
No. I riferimenti multimediali comunicano l'intento creativo ma non garantiscono l'esatta identità, il movimento, la voce, la struttura del prodotto o la riproduzione a livello di fotogramma. L'uso in produzione richiede una revisione visiva e audio.
Scopri altri modelli AI per il tuo prossimo workflow creativo