Les deux modes utilisent le même tarif APIXO : $0.05 par seconde générée en 480p, $0.10 en 720p et $0.15 en 1080p. Les sorties de cinq secondes coûtent $0.25, $0.50 ou $0.75 ; les sorties de dix secondes coûtent $0.50, $1.00 ou $1.50.
La vidéo Wan 2.5 est la voie opérationnelle d'APIXO pour la famille de modèles vidéo Wan 2.5 d'Alibaba. Générez des clips audiovisuels de 5 ou 10 secondes à partir d'un prompt textuel ou d'une image source, avec audio personnalisé en option, trois niveaux de résolution, expansion de prompt, prompt négatif, itération basée sur un seed et livraison asynchrone.
Workflows
Texte / Image vers Vidéo
Prix APIXO
$0.05–$0.15 / sNiveaux de tarification backend 480p, 720p et 1080p
Résolution
480p / 720p / 1080p
Durée
5 / 10 secondes
Sortie
1 vidéo MP4
Chargement de l'espace de travail...
Wan 2.5 génère la vidéo avec l'audio par défaut plutôt que de retourner des séquences silencieuses, réduisant ainsi le besoin d'assembler une bande-son initiale dans une étape de génération séparée.
Fournissez un fichier public MP3 ou WAV comme référence audio. Wan l'utilise pour synchroniser les visuels générés et, le cas échéant, le mouvement de la bouche avec la musique ou la voix off fournie. La formulation exacte, la prononciation, l'identité du locuteur et la synchronisation labiale nécessitent toujours une vérification.
Décrivez les sujets, l'action, les environnements, le comportement de la caméra, les dialogues, la musique ou les effets sonores en chinois ou en anglais à l'aide d'un prompt allant jusqu'à 1500 caractères.
Animez une image source tout en utilisant un prompt facultatif pour guider le mouvement et le développement de la scène. L'image établit le contexte visuel sans garantir la préservation exacte de chaque détail.
La réécriture du prompt est activée par défaut pour enrichir les instructions plus courtes. Désactivez-la lorsque la préservation d'une formulation soigneusement rédigée est plus importante que le bénéfice créatif potentiel.
Utilisez un prompt négatif pour décourager les caractéristiques non désirées et un seed numérique pour améliorer la répétabilité. Des paramètres et des seeds identiques ne garantissent pas des vidéos identiques.
Soumettez un prompt obligatoire et non vide de 1 500 caractères maximum sans image source. Sélectionnez 5 ou 10 secondes, l'une des trois résolutions et un format d'image compatible. Les contrôles optionnels pour l'audio, le prompt négatif, l'expansion du prompt, le seed et le filigrane peuvent affiner la requête.
Fournissez exactement une URL d'image publique et décrivez éventuellement le mouvement ou la scène souhaitée. Ne soumettez pas de champ de format d'image dans ce mode ; l'image source guide l'état visuel initial et la composition mais ne garantit pas l'identité exacte, le texte, les logos, la géométrie, l'arrière-plan ou le cadrage.
Options de production actuelles pour la route opérationnelle wan-2-5-video.
1–1500
Caractères du prompt
1 URL publique
Image Source
1 MP3 / WAV
Référence audio
500 caractères
Prompt négatif
0–2 147 483 647
Plage du seed
Sondage / Rappel (Polling / Callback)
Livraison
Transformez un brief de campagne en courtes révélations de produits, scènes de vie ou concepts de lancement avec une bande sonore initiale. Vérifiez les proportions du produit, le contact avec les objets, les mains, les logos et le texte incrusté avant de passer une idée en production.
Ajoutez du mouvement à vos photographies de produits, illustrations, affiches ou créations de personnages à l'aide d'une seule image source. Après la génération, vérifiez la fidélité de l'identité, de la composition, de l'arrière-plan et des détails par rapport à l'original.
Associez un court extrait musical, une ébauche de narration ou une référence de design sonore avec des visuels générés pour des concepts promotionnels et sociaux. Validez indépendamment le texte parlé, la prononciation, le mouvement de la bouche et la synchronisation audiovisuelle.
Explorez l'orientation de la caméra, la composition de la scène, le mouvement et les concepts de formation ou d'explication à travers de courtes ébauches. Utilisez des générations de 5 secondes à plus basse résolution pour itérer avant d'engager un budget pour des versions plus longues et en plus haute résolution.
APIXO expose la famille de vidéos Wan 2.5 d'Alibaba sous une seule route, mais ne documente pas publiquement une correspondance mode par mode avec wan2.5-t2v-preview et wan2.5-i2v-preview.
L'image vers vidéo accepte une URL publique d'image JPEG, JPG, PNG sans canal alpha, BMP ou WebP ne dépassant pas 20 Mo ; chaque dimension doit être comprise entre 240 et 8 000 pixels.
Le mode texte vers vidéo prend en charge les formats d'image 16:9, 9:16 et 1:1 à toutes les résolutions ; les formats 4:3 et 3:4 nécessitent une résolution de 720p ou 1080p.
L'audio optionnel doit utiliser une URL publique MP3 ou WAV, ne dépassant pas 15 Mo, avec une durée documentée allant de 3 à 30 secondes.
Les délais de traitement typiques sont de 40 à 120 secondes en 480p, de 60 à 180 secondes en 720p et de 90 à 250 secondes en 1080p. APIXO recommande un premier sondage (polling) après respectivement 40, 60 ou 90 secondes, suivi d'intervalles de 10 secondes ; ces durées sont des estimations et non un SLA.
Les URL de résultat sont temporaires, sans période de rétention publique fixe. Téléchargez rapidement les sorties requises et examinez-les pour vérifier leur sécurité et les autorisations relatives au matériel source.
Les deux modes utilisent le même tarif APIXO : $0.05 par seconde générée en 480p, $0.10 en 720p et $0.15 en 1080p. Les sorties de cinq secondes coûtent $0.25, $0.50 ou $0.75 ; les sorties de dix secondes coûtent $0.50, $1.00 ou $1.50.
L'audio plus long que la durée de la vidéo sélectionnée est tronqué aux 5 ou 10 premières secondes. S'il est plus court, le reste du segment vidéo est silencieux. APIXO n'applique aucun frais supplémentaire pour l'audio personnalisé, l'entrée d'image ou l'extension de prompt.
Le modèle Wan 2.5 en amont peut utiliser une voix, des effets sonores et une musique de fond décrits dans le prompt lors de la génération audio. Cependant, APIXO ne fournit aucune garantie quant à l'exactitude des dialogues, de la prononciation, de l'identité vocale, de l'attribution des locuteurs ou de la synchronisation labiale, et n'expose aucun contrôle de clonage vocal.
Les tâches s'exécutent de manière asynchrone avec les états "en attente", "en traitement", "réussi" ou "échoué". L'interrogation (polling) renvoie l'URL finale du MP4 dans resultJson.resultUrls ; le mode rappel (callback) envoie la charge utile terminale à une URL de rappel HTTPS publique. Les échecs incluent des champs de code et de message lisibles par machine.
APIXO n'expose pas de durée arbitraire, de dimensions personnalisées, de FPS configurables, de nombre de sorties, d'échelle CFG, d'intensité de mouvement, de préréglages de caméra, de nombre de plans, de poids de référence, de mode multi-plans, de montage, de continuation, ou d'un interrupteur de sortie silencieuse. L'activation de `watermark` ajoute le texte fixe `AI 生成` en bas à droite. Alibaba documente ses sorties Wan 2.5 Preview comme étant des MP4 H.264 à 30 ips, tandis qu'APIXO n'expose aucun contrôle de codec ou de fréquence d'images.
Découvrez d'autres modèles d'IA pour votre prochain workflow créatif