Entrambe le modalità utilizzano la stessa tariffa APIXO: $0.05 per secondo generato a 480p, $0.10 a 720p e $0.15 a 1080p. Gli output di cinque secondi costano $0.25, $0.50 o $0.75; quelli di dieci secondi costano $0.50, $1.00 o $1.50.
Wan 2.5 Video è il canale operativo di APIXO per la famiglia di modelli video Wan 2.5 di Alibaba. Genera clip audiovisive da 5 o 10 secondi da un prompt di testo o da un'immagine sorgente, con audio personalizzato opzionale, tre livelli di risoluzione, espansione del prompt, prompt negativo, iterazione basata su seed e consegna asincrona.
Flussi di lavoro
Testo / Immagine a Video
Prezzo APIXO
$0.05–$0.15 / secLivelli di prezzo backend per 480p, 720p e 1080p
Risoluzione
480p / 720p / 1080p
Durata
5 / 10 secondi
Output
1 video MP4
Caricamento dell'area di lavoro...
Wan 2.5 genera video con audio invece di restituire filmati muti per impostazione predefinita, riducendo la necessità di assemblare una colonna sonora iniziale in un passaggio di generazione separato.
Fornisca un file MP3 o WAV pubblico come riferimento audio. Wan lo utilizza per sincronizzare gli elementi visivi generati e, dove applicabile, il movimento della bocca con la musica o la voce fuori campo fornita. La formulazione esatta, la pronuncia, l'identità del parlante e la sincronizzazione labiale richiedono comunque una revisione.
Descriva soggetti, azioni, ambienti, movimenti della fotocamera, dialoghi, musica o effetti sonori in cinese o inglese usando un prompt fino a 1.500 caratteri.
Animi un'immagine sorgente usando un prompt opzionale per guidare il movimento e lo sviluppo della scena. L'immagine stabilisce il contesto visivo senza garantire la conservazione esatta di ogni dettaglio.
La riscrittura del prompt è abilitata per impostazione predefinita per arricchire le istruzioni più brevi. La disabiliti quando la conservazione di una formulazione attentamente elaborata è più importante del potenziale beneficio creativo.
Utilizzare un prompt negativo per scoraggiare caratteristiche indesiderate e un seed numerico per migliorare la ripetibilità. Impostazioni e seed identici non garantiscono video identici.
Invii un prompt obbligatorio e non vuoto di massimo 1.500 caratteri senza un'immagine di origine. Selezioni 5 o 10 secondi, una delle tre risoluzioni e un rapporto d'aspetto compatibile. I controlli opzionali per audio, prompt negativo, espansione del prompt, seed e filigrana possono affinare la richiesta.
Fornisca esattamente un URL di immagine pubblica e, facoltativamente, descriva il movimento o la scena desiderata. Non invii un campo per il rapporto d'aspetto in questa modalità; l'immagine di origine guida lo stato visivo iniziale e la composizione, ma non garantisce l'identità esatta, il testo, i loghi, la geometria, lo sfondo o l'inquadratura.
Opzioni di produzione attuali per il percorso operativo wan-2-5-video.
1–1.500
Caratteri del prompt
1 URL pubblico
Immagine di origine
1 MP3 / WAV
Riferimento audio
500 caratteri
Prompt negativo
0–2.147.483.647
Intervallo del seed
Polling / Callback
Consegna
Trasformi il brief di una campagna in brevi presentazioni di prodotti, scene di lifestyle o concetti di lancio con una colonna sonora iniziale. Esamini le proporzioni del prodotto, il contatto con gli oggetti, le mani, i loghi e il testo incorporato prima di portare un'idea in produzione.
Aggiunga movimento a fotografie di prodotti, illustrazioni, poster o character art utilizzando una singola immagine sorgente. Dopo la generazione, verifichi l'identità, la composizione, lo sfondo e la fedeltà dei dettagli rispetto all'asset originale.
Abbini un breve estratto musicale, una bozza di narrazione o un riferimento di sound design a elementi visivi generati per concetti promozionali e social. Convalidi in modo indipendente il testo parlato, la pronuncia, il movimento della bocca e la sincronizzazione audiovisiva.
Esplori la direzione della telecamera, la composizione della scena, il movimento e i concetti per corsi di formazione o video esplicativi attraverso brevi bozze. Utilizzi generazioni a risoluzione più bassa e di 5 secondi per l'iterazione, prima di impegnare il budget in versioni più lunghe e ad alta risoluzione.
APIXO espone la famiglia di video Wan 2.5 di Alibaba tramite un'unica route, ma non documenta pubblicamente una mappatura modalità per modalità con wan2.5-t2v-preview e wan2.5-i2v-preview.
La funzione immagine a video accetta un URL pubblico di un'immagine JPEG, JPG, PNG senza canale alfa, BMP o WebP non più grande di 20 MB; ogni dimensione deve essere compresa tra 240 e 8.000 pixel.
La modalità testo a video supporta i rapporti 16:9, 9:16 e 1:1 a ogni risoluzione; i rapporti 4:3 e 3:4 richiedono 720p o 1080p.
L'audio opzionale deve utilizzare un URL pubblico di un file MP3 o WAV, non più grande di 15 MB, con una durata documentata compresa tra 3 e 30 secondi.
I tempi di elaborazione tipici variano da 40 a 120 secondi a 480p, da 60 a 180 secondi a 720p e da 90 a 250 secondi a 1080p. APIXO consiglia il primo polling rispettivamente dopo 40, 60 o 90 secondi, seguito da intervalli di polling di 10 secondi; queste tempistiche sono stime e non costituiscono un SLA.
Gli URL dei risultati sono temporanei, senza un periodo di conservazione pubblico fisso. Scarichi tempestivamente gli output necessari e li esamini per verificarne la sicurezza e le autorizzazioni del materiale di origine.
Entrambe le modalità utilizzano la stessa tariffa APIXO: $0.05 per secondo generato a 480p, $0.10 a 720p e $0.15 a 1080p. Gli output di cinque secondi costano $0.25, $0.50 o $0.75; quelli di dieci secondi costano $0.50, $1.00 o $1.50.
L'audio più lungo della durata del video selezionata viene troncato ai primi 5 o 10 secondi. Se è più breve, il segmento video rimanente è silenzioso. APIXO non applica costi aggiuntivi per audio personalizzato, input di immagini o espansione del prompt.
Il modello Wan 2.5 può utilizzare voci, effetti sonori e musica di sottofondo descritti nel prompt durante la generazione dell'audio. Tuttavia, APIXO non fornisce garanzie sull'esattezza dei dialoghi, sulla pronuncia, sull'identità vocale, sull'attribuzione del parlante o sulla sincronizzazione labiale, e non espone controlli per il clonaggio vocale.
Le attività vengono eseguite in modo asincrono con stati di pending, processing, success o failed. Il polling restituisce l'URL MP4 finale all'interno di resultJson.resultUrls; la modalità callback invia il payload finale a un URL di callback HTTPS pubblico. I fallimenti includono campi di codice e messaggio leggibili dalla macchina.
APIXO non espone durata arbitraria, dimensioni personalizzate, FPS configurabili, numero di output, scala CFG, intensità del movimento, preset della fotocamera, numero di inquadrature, pesi dei riferimenti, modalità multi-shot, editing, continuazione o un interruttore per l'output silenzioso. Abilitando `watermark` si aggiunge il testo fisso `AI 生成` in basso a destra. Alibaba documenta i suoi output Wan 2.5 Preview come MP4 H.264 a 30 fps, mentre APIXO non espone controlli su codec o frame rate.
Scopri altri modelli AI per il tuo prossimo workflow creativo