Sí. El modelo está activo en el punto de acceso de tareas asíncronas de APIXO y se puede llamar con la misma clave API que cualquier otro modelo del catálogo. La generación también está disponible en el Playground en esta página.
MiniMax H3 es un modelo de vídeo multimodal de propósito general que combina contexto de texto, imagen, vídeo y audio en un solo flujo de trabajo de generación. Crea vídeos de hasta 2K y 15 segundos con sonido estéreo nativo, a la vez que admite control del primer y último fotograma, referencias de medios mixtos, transferencia de movimiento, narración multi-toma y edición de vídeo guiada por instrucciones.
Entradas
Texto / Imagen / Vídeo / Audio
Precio de APIXO
$0.09–$0.13 / segundo
Resolución
768P / 2K
Duración
5-15 segundos
Audio
Sonido estéreo nativo
Cargando espacio de trabajo...
Combine la dirección escrita con referencias de imagen, vídeo y audio en una sola solicitud. Asigne a cada fuente un rol como apariencia, movimiento, cámara, voz, ritmo, entorno o estilo.
Defina un fotograma de apertura, un fotograma de cierre, o ambos, para guiar transformaciones, transiciones, revelaciones de productos y momentos clave del storyboard, preservando al mismo tiempo una trayectoria visual más clara.
Use imágenes, vídeos y audio de referencia en conjunto para comunicar la identidad del personaje, las pistas del producto, el movimiento, el lenguaje de cámara, la interpretación vocal, la música o el ambiente.
Genere voz, efectos de sonido, ambiente y música junto con el vídeo como audio estéreo nativo, en lugar de ensamblar pistas de audio aisladas después de la generación.
Construya secuencias cortas con cambios de plano coordinados, progresión de escena, continuidad de acción y ritmo audiovisual desde un único flujo de trabajo guiado por prompt o referencias.
Transforme material visual existente mediante dirección en lenguaje natural o transfiera el movimiento desde referencias de vídeo mientras revisa la identidad, la composición, la oclusión y la fidelidad de los detalles de la fuente.
Combine imágenes de productos, dirección escrita, referencias de movimiento e intención de sonido para desarrollar conceptos de campaña. Revise etiquetas, logotipos, materiales, dimensiones y geometría del producto antes de aprobar los activos comerciales generados.
Establezca un sujeto recurrente con referencias visuales, luego guíe el movimiento, el comportamiento de la cámara, la voz o el contexto de la escena a través de medios adicionales. Evalúe la continuidad de la identidad, la anatomía, la expresión y la sincronización de la actuación en todo el resultado completo.
Traduzca un tratamiento en escenas cortas que combinen acción, lenguaje de cámara, ambiente y ritmo audiovisual. Use el metraje generado para evaluar ideas antes de comprometerse con la producción física o la postproducción detallada.
Explore cambios de estilo, entorno, sujeto o escena mediante instrucciones en lenguaje natural y referencias opcionales. Inspeccione los límites temporales, la oclusión, las modificaciones no deseadas y la preservación de los detalles de origen fotograma a fotograma.
Confirmado con el despliegue en vivo de APIXO.
Texto / Imagen / Vídeo / Audio
Entrada
T2V / I2V / Referencia
Flujos de trabajo
768P / 2K
Resolución
5–15 segundos
Duración
Estéreo nativo
Audio
6 relaciones + adaptativa
Encuadre
MiniMax H3 se ejecuta en el punto de acceso de tareas asíncronas de APIXO. Envíe a generateTask y consulte statusTask, o proporcione una URL de callback para la entrega por webhook.
Se exponen tres modos: texto a vídeo, imagen a vídeo y referencia a vídeo. Imagen a vídeo toma de 1 a 2 imágenes como primer fotograma y último opcional; referencia a vídeo necesita al menos una imagen o un vídeo de referencia.
La salida es de 768p o 2K de 5 a 15 segundos, solo segundos enteros. La resolución establece la tarifa por segundo. Los prompts están limitados a 4000 caracteres. El vídeo y el audio de referencia están limitados a 3 archivos cada uno, de 2 a 15 segundos por archivo y 15 segundos en total.
“MiniMax H3” es el ID del modelo de APIXO. No transfiera los valores de los parámetros, los niveles de calidad ni el comportamiento de facturación de Hailuo 2.3 o Hailuo 2.3 Fast, ya que son rutas separadas con contratos diferentes.
Las referencias guían la generación, pero no garantizan la identidad exacta, la tipografía, los logotipos, los materiales o la geometría del producto.
Revise la anatomía, las manos, el contacto con objetos, el movimiento rápido, la oclusión, las transiciones de cámara, el habla y la sincronización audiovisual antes del lanzamiento.
Sí. El modelo está activo en el punto de acceso de tareas asíncronas de APIXO y se puede llamar con la misma clave API que cualquier otro modelo del catálogo. La generación también está disponible en el Playground en esta página.
Texto a vídeo, imagen a vídeo y referencia a vídeo. El modo de referencia a vídeo acepta hasta 9 imágenes, 3 vídeos y 3 archivos de audio como contexto creativo combinado; el audio no se puede proporcionar por sí solo.
Salida de 768p o 2K de 5 a 15 segundos, en segundos enteros. 2K es la opción predeterminada y el nivel más alto que ofrece el punto de acceso; 768p se factura a una tarifa por segundo más baja. La relación de aspecto se puede configurar en 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16 para texto a vídeo y referencia a vídeo; imagen a vídeo toma su encuadre del primer fotograma proporcionado.
El vídeo de salida se factura por segundo en todos los modos, a la tarifa que corresponde a la resolución elegida: 768p es más barato por segundo que 2K. En el modo de referencia a vídeo, los segundos reales de sus vídeos de referencia se facturan a la misma tarifa por segundo, y las primeras 5 imágenes de referencia son gratuitas, cobrándose cada imagen adicional por separado. El audio de referencia no se factura. Consulte la pestaña de precios para ver las tarifas actuales.
Sí. El audio se produce en el mismo paso que la imagen como estéreo nativo, con voz, efectos de sonido, ambiente y música modelados conjuntamente en lugar de como pistas separadas.
No. Las referencias de medios mixtos comunican la intención creativa, pero no garantizan la identidad exacta, el movimiento, la voz, la estructura del producto ni la reproducción a nivel de fotograma. El uso en producción requiere una revisión visual y de audio.
Descubra más modelos de IA para su próximo flujo de trabajo creativo