Oui. Le modèle est actif sur le point de terminaison de tâches asynchrones d'APIXO et peut être appelé avec la même clé API que tous les autres modèles du catalogue. La génération est également disponible dans le Playground sur cette page.
MiniMax H3 est un modèle vidéo multimodal polyvalent qui combine le contexte texte, image, vidéo et audio dans un seul flux de travail de génération. Il crée des vidéos jusqu'à 2K et 15 secondes avec un son stéréo natif, tout en prenant en charge le contrôle de la première et de la dernière image, les références multimédias, le transfert de mouvement, la narration multi-plans et le montage vidéo guidé par instructions.
Entrées
Texte / Image / Vidéo / Audio
Prix APIXO
$0.09–$0.13 / seconde
Résolution
768p / 2K
Durée
5–15 s
Audio
Son stéréo natif
Chargement de l'espace de travail...
Combinez une direction écrite avec des références d'image, de vidéo et d'audio en une seule requête. Attribuez à chaque source un rôle tel que l'apparence, le mouvement, la caméra, la voix, le rythme, l'environnement ou le style.
Définissez une image de début, une image de fin, ou les deux, pour guider les transformations, les transitions, les révélations de produits et les temps forts du storyboard tout en préservant une trajectoire visuelle plus claire.
Utilisez ensemble des images, vidéos et fichiers audio de référence pour communiquer l'identité d'un personnage, des indices sur le produit, le mouvement, le langage cinématographique, la performance vocale, la musique ou l'ambiance.
Générez la voix, les effets sonores, l'ambiance et la musique en même temps que la vidéo en tant qu'audio stéréo natif, plutôt que d'assembler des pistes audio isolées après la génération.
Créez de courtes séquences avec des changements de plans coordonnés, une progression de scène, une continuité d'action et un rythme audiovisuel à partir d'un seul workflow piloté par prompt ou guidé par référence.
Transformez le matériel visuel existant par des instructions en langage naturel ou transférez le mouvement à partir de références vidéo, tout en vérifiant l'identité, la composition, l'occlusion et la fidélité des détails de la source.
Combinez l'imagerie produit, la direction écrite, les références de mouvement et l'intention sonore pour développer des concepts de campagne. Examinez les étiquettes, logos, matériaux, dimensions et la géométrie du produit avant d'approuver les ressources commerciales générées.
Établissez un sujet récurrent avec des références visuelles, puis guidez le mouvement, le comportement de la caméra, la voix ou le contexte de la scène via des médias supplémentaires. Évaluez la continuité de l'identité, l'anatomie, l'expression et le timing de la performance sur l'ensemble du résultat.
Traduisez un traitement en scènes courtes qui combinent action, langage cinématographique, ambiance et rythme audiovisuel. Utilisez les séquences générées pour évaluer des idées avant de vous engager dans une production physique ou une post-production détaillée.
Explorez les changements de style, d'environnement, de sujet ou de scène grâce à des instructions en langage naturel et des références optionnelles. Inspectez image par image les limites temporelles, l'occlusion, les modifications non intentionnelles et la préservation des détails de la source.
Confirmé sur le déploiement en direct d'APIXO.
Texte / Image / Vidéo / Audio
Entrée
T2V / I2V / Référence
Workflows
768p / 2K
Résolution
5–15 s
Durée
Stéréo natif
Audio
6 formats + adaptatif
Cadrage
MiniMax H3 fonctionne sur le point de terminaison de tâches asynchrones d'APIXO. Soumettez à generateTask et interrogez statusTask, ou fournissez une URL de rappel pour la livraison par webhook.
Trois modes sont disponibles : texte-vers-vidéo, image-vers-vidéo et référence-vers-vidéo. Le mode image-vers-vidéo prend 1 à 2 images comme première et dernière image optionnelle ; le mode référence-vers-vidéo nécessite au moins une image ou une vidéo de référence.
La sortie est en 768p ou 2K, de 5 à 15 secondes, en secondes entières uniquement. La résolution détermine le tarif par seconde. Les prompts sont limités à 4 000 caractères. La vidéo et l'audio de référence sont chacun limités à 3 fichiers, de 2 à 15 secondes par fichier et 15 secondes au total.
« MiniMax H3 » est l'ID du modèle APIXO. Ne reportez pas les valeurs des paramètres, les niveaux de qualité ou le comportement de facturation de Hailuo 2.3 ou Hailuo 2.3 Fast — ce sont des routes distinctes avec des contrats différents.
Les références guident la génération mais ne garantissent pas l'exactitude de l'identité, de la typographie, des logos, des matériaux ou de la géométrie du produit.
Vérifiez l'anatomie, les mains, le contact avec les objets, les mouvements rapides, l'occlusion, les transitions de caméra, la parole et la synchronisation audiovisuelle avant la diffusion.
Oui. Le modèle est actif sur le point de terminaison de tâches asynchrones d'APIXO et peut être appelé avec la même clé API que tous les autres modèles du catalogue. La génération est également disponible dans le Playground sur cette page.
Texte-vers-vidéo, image-vers-vidéo et référence-vers-vidéo. Le mode référence-vers-vidéo accepte jusqu'à 9 images, 3 vidéos et 3 fichiers audio comme contexte créatif combiné ; l'audio ne peut pas être fourni seul.
Sortie en 768p ou 2K de 5 à 15 secondes, en secondes entières. Le 2K est la résolution par défaut et la plus élevée exposée par la route ; le 768p est facturé à un tarif par seconde inférieur. Le format d'image peut être réglé sur 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16 pour le texte vers vidéo et la référence vers vidéo ; l'image vers vidéo prend son cadrage de la première image fournie.
La vidéo de sortie est facturée par seconde dans tous les modes, au tarif correspondant à la résolution choisie — le 768p est moins cher par seconde que le 2K. En mode référence vers vidéo, la durée réelle de vos vidéos de référence est facturée au même tarif par seconde, et les 5 premières images de référence sont gratuites, chaque image supplémentaire étant facturée séparément. L'audio de référence n'est pas facturé. Consultez l'onglet des tarifs pour les prix actuels.
Oui. L'audio est produit dans la même passe que l'image, en stéréo native, avec la parole, les effets sonores, l'ambiance et la musique modélisés conjointement plutôt que comme des pistes séparées.
Non. Les références multimédias communiquent une intention créative mais ne garantissent pas l'exactitude de l'identité, du mouvement, de la voix, de la structure du produit ou de la reproduction image par image. Une utilisation en production nécessite une vérification visuelle et audio.
Découvrez d'autres modèles d'IA pour votre prochain workflow créatif