Entrambe le modalità utilizzano la stessa tariffa APIXO: $0.05 per secondo generato a 480p, $0.10 a 720p e $0.15 a 1080p. Gli output di cinque secondi costano $0.25, $0.50 o $0.75; quelli di dieci secondi costano $0.50, $1.00 o $1.50.
Wan 2.5
Wan 2.5 Video è il canale operativo di APIXO per la famiglia di modelli video Wan 2.5 di Alibaba. Genera clip audiovisive da 5 o 10 secondi da un prompt di testo o da un'immagine sorgente, con audio personalizzato opzionale, tre livelli di risoluzione, espansione del prompt, prompt negativo, iterazione basata su seed e consegna asincrona.
Flussi di lavoro
Testo / Immagine a Video
Prezzo APIXO
$0.05–$0.15 / secLivelli di prezzo backend per 480p, 720p e 1080p
Risoluzione
480p / 720p / 1080p
Durata
5 / 10 secondi
Output
1 video MP4
Crea con Wan 2.5

Dirigere scene, movimenti, inquadrature e suono
Output audiovisivo integrato
Wan 2.5 genera video con audio invece di restituire filmati muti per impostazione predefinita, riducendo la necessità di assemblare una colonna sonora iniziale in un passaggio di generazione separato.
Sincronizzazione audio personalizzata
Fornisca un file MP3 o WAV pubblico come riferimento audio. Wan lo utilizza per sincronizzare gli elementi visivi generati e, dove applicabile, il movimento della bocca con la musica o la voce fuori campo fornita. La formulazione esatta, la pronuncia, l'identità del parlante e la sincronizzazione labiale richiedono comunque una revisione.
Scene guidate dal prompt
Descriva soggetti, azioni, ambienti, movimenti della fotocamera, dialoghi, musica o effetti sonori in cinese o inglese usando un prompt fino a 1.500 caratteri.
Animazione da immagine singola
Animi un'immagine sorgente usando un prompt opzionale per guidare il movimento e lo sviluppo della scena. L'immagine stabilisce il contesto visivo senza garantire la conservazione esatta di ogni dettaglio.
Espansione automatica del prompt
La riscrittura del prompt è abilitata per impostazione predefinita per arricchire le istruzioni più brevi. La disabiliti quando la conservazione di una formulazione attentamente elaborata è più importante del potenziale beneficio creativo.
Iterazione controllata
Utilizzare un prompt negativo per scoraggiare caratteristiche indesiderate e un seed numerico per migliorare la ripetibilità. Impostazioni e seed identici non garantiscono video identici.
Inizi con una scena scritta o un'ancora visiva
Testo a video
Invii un prompt obbligatorio e non vuoto di massimo 1.500 caratteri senza un'immagine di origine. Selezioni 5 o 10 secondi, una delle tre risoluzioni e un rapporto d'aspetto compatibile. I controlli opzionali per audio, prompt negativo, espansione del prompt, seed e filigrana possono affinare la richiesta.
Immagine a video
Fornisca esattamente un URL di immagine pubblica e, facoltativamente, descriva il movimento o la scena desiderata. Non invii un campo per il rapporto d'aspetto in questa modalità; l'immagine di origine guida lo stato visivo iniziale e la composizione, ma non garantisce l'identità esatta, il testo, i loghi, la geometria, lo sfondo o l'inquadratura.
Input e controlli esposti da APIXO
Opzioni di produzione attuali per il percorso operativo wan-2-5-video.
1–1.500
Caratteri del prompt
1 URL pubblico
Immagine di origine
1 MP3 / WAV
Riferimento audio
500 caratteri
Prompt negativo
0–2.147.483.647
Intervallo del seed
Polling / Callback
Consegna
Sviluppare brevi concept audiovisivi per la revisione
Prototipazione di scene promozionali
Trasformi il brief di una campagna in brevi presentazioni di prodotti, scene di lifestyle o concetti di lancio con una colonna sonora iniziale. Esamini le proporzioni del prodotto, il contatto con gli oggetti, le mani, i loghi e il testo incorporato prima di portare un'idea in produzione.
Animare elementi visivi chiave
Aggiunga movimento a fotografie di prodotti, illustrazioni, poster o character art utilizzando una singola immagine sorgente. Dopo la generazione, verifichi l'identità, la composizione, lo sfondo e la fedeltà dei dettagli rispetto all'asset originale.
Costruire attorno all'audio fornito
Abbini un breve estratto musicale, una bozza di narrazione o un riferimento di sound design a elementi visivi generati per concetti promozionali e social. Convalidi in modo indipendente il testo parlato, la pronuncia, il movimento della bocca e la sincronizzazione audiovisiva.
Test e video esplicativi
Esplori la direzione della telecamera, la composizione della scena, il movimento e i concetti per corsi di formazione o video esplicativi attraverso brevi bozze. Utilizzi generazioni a risoluzione più bassa e di 5 secondi per l'iterazione, prima di impegnare il budget in versioni più lunghe e ad alta risoluzione.
Regole operative e limiti di revisione
Prima di generare
APIXO espone la famiglia di video Wan 2.5 di Alibaba tramite un'unica route, ma non documenta pubblicamente una mappatura modalità per modalità con wan2.5-t2v-preview e wan2.5-i2v-preview.
La funzione immagine a video accetta un URL pubblico di un'immagine JPEG, JPG, PNG senza canale alfa, BMP o WebP non più grande di 20 MB; ogni dimensione deve essere compresa tra 240 e 8.000 pixel.
La modalità testo a video supporta i rapporti 16:9, 9:16 e 1:1 a ogni risoluzione; i rapporti 4:3 e 3:4 richiedono 720p o 1080p.
L'audio opzionale deve utilizzare un URL pubblico di un file MP3 o WAV, non più grande di 15 MB, con una durata documentata compresa tra 3 e 30 secondi.
I tempi di elaborazione tipici variano da 40 a 120 secondi a 480p, da 60 a 180 secondi a 720p e da 90 a 250 secondi a 1080p. APIXO consiglia il primo polling rispettivamente dopo 40, 60 o 90 secondi, seguito da intervalli di polling di 10 secondi; queste tempistiche sono stime e non costituiscono un SLA.
Gli URL dei risultati sono temporanei, senza un periodo di conservazione pubblico fisso. Scarichi tempestivamente gli output necessari e li esamini per verificarne la sicurezza e le autorizzazioni del materiale di origine.
Domande frequenti
L'audio più lungo della durata del video selezionata viene troncato ai primi 5 o 10 secondi. Se è più breve, il segmento video rimanente è silenzioso. APIXO non applica costi aggiuntivi per audio personalizzato, input di immagini o espansione del prompt.
Il modello Wan 2.5 può utilizzare voci, effetti sonori e musica di sottofondo descritti nel prompt durante la generazione dell'audio. Tuttavia, APIXO non fornisce garanzie sull'esattezza dei dialoghi, sulla pronuncia, sull'identità vocale, sull'attribuzione del parlante o sulla sincronizzazione labiale, e non espone controlli per il clonaggio vocale.
Le attività vengono eseguite in modo asincrono con stati di pending, processing, success o failed. Il polling restituisce l'URL MP4 finale all'interno di resultJson.resultUrls; la modalità callback invia il payload finale a un URL di callback HTTPS pubblico. I fallimenti includono campi di codice e messaggio leggibili dalla macchina.
APIXO non espone durata arbitraria, dimensioni personalizzate, FPS configurabili, numero di output, scala CFG, intensità del movimento, preset della fotocamera, numero di inquadrature, pesi dei riferimenti, modalità multi-shot, editing, continuazione o un interruttore per l'output silenzioso. Abilitando `watermark` si aggiunge il testo fisso `AI 生成` in basso a destra. Alibaba documenta i suoi output Wan 2.5 Preview come MP4 H.264 a 30 fps, mentre APIXO non espone controlli su codec o frame rate.
Esplora altri modelli
Scopri altri modelli AI per il tuo prossimo workflow creativo