Ja. Das Modell ist live auf dem asynchronen Task-Endpunkt von APIXO verfügbar und kann mit demselben API-Schlüssel wie jedes andere Modell im Katalog aufgerufen werden. Die Erstellung ist auch im Playground auf dieser Seite verfügbar.
MiniMax H3 ist ein multimodales Allzweck-Videomodell, das Text-, Bild-, Video- und Audiokontext in einem einzigen Erstellungs-Workflow kombiniert. Es erstellt Videos mit bis zu 2K und 15 Sekunden Länge mit nativem Stereo-Sound und unterstützt dabei die Steuerung des ersten und letzten Frames, Mixed-Media-Referenzen, Bewegungsübertragung, Multi-Shot-Storytelling und anweisungsgesteuerte Videobearbeitung.
Inputs
Text / Bild / Video / Audio
APIXO Preis
$0.09–$0.13 / Sekunde
Auflösung
768p / 2K
Dauer
5-15 Sekunden
Audio
Nativer Stereo-Sound
Arbeitsbereich wird geladen...
Kombinieren Sie schriftliche Anweisungen mit Bild-, Video- und Audioreferenzen in einer einzigen Anfrage. Weisen Sie jeder Quelle eine Rolle zu, wie Aussehen, Bewegung, Kamera, Stimme, Rhythmus, Umgebung oder Stil.
Definieren Sie ein Anfangsbild, ein Endbild oder beides, um Transformationen, Übergänge, Produktenthüllungen und Storyboard-Beats zu steuern, während eine klarere visuelle Trajektorie beibehalten wird.
Verwenden Sie Referenzbilder, -videos und -audiodateien gemeinsam, um Charakteridentität, Produktmerkmale, Bewegung, Kamerasprache, stimmliche Darbietung, Musik oder Ambiente zu vermitteln.
Erstellen Sie Stimme, Soundeffekte, Ambiente und Musik zusammen mit dem Video als natives Stereo-Audio, anstatt nach der Erstellung isolierte Audiospuren zusammenzufügen.
Erstellen Sie kurze Sequenzen mit koordinierten Einstellungswechseln, Szenenfortschritt, Handlungskontinuität und audiovisuellem Pacing aus einem einzigen Prompt-geführten oder referenzgesteuerten Workflow.
Transformieren Sie vorhandenes visuelles Material durch Anweisungen in natürlicher Sprache oder übertragen Sie Bewegungen aus Videoreferenzen, während Sie Identität, Komposition, Verdeckung und Detailtreue der Quelle überprüfen.
Kombinieren Sie Produktbilder, schriftliche Anweisungen, Bewegungsreferenzen und Sound-Absichten, um Kampagnenkonzepte zu entwickeln. Überprüfen Sie Etiketten, Logos, Materialien, Abmessungen und Produktgeometrie, bevor Sie erstellte kommerzielle Assets genehmigen.
Etablieren Sie ein wiederkehrendes Subjekt mit visuellen Referenzen und steuern Sie dann Bewegung, Kameraverhalten, Stimme oder Szenenkontext durch zusätzliche Medien. Bewerten Sie die Kontinuität der Identität, Anatomie, den Ausdruck und das Timing der Performance im gesamten Ergebnis.
Setzen Sie ein Treatment in kurze Szenen um, die Handlung, Kamerasprache, Ambiente und audiovisuelles Pacing kombinieren. Nutzen Sie das erstellte Material, um Ideen zu bewerten, bevor Sie sich für die physische Produktion oder eine detaillierte Postproduktion entscheiden.
Erkunden Sie Änderungen an Stil, Umgebung, Subjekt oder Szene durch Anweisungen in natürlicher Sprache und optionale Referenzen. Überprüfen Sie Bild für Bild zeitliche Abgrenzungen, Verdeckungen, unbeabsichtigte Änderungen und die Beibehaltung von Quelldetails.
Bestätigt mit dem Live-Deployment von APIXO.
Text / Bild / Video / Audio
Eingabe
T2V / I2V / Referenz
Workflows
768p / 2K
Auflösung
5–15 Sekunden
Dauer
Natives Stereo
Audio
6 Seitenverhältnisse + Adaptiv
Bildaufbau
MiniMax H3 läuft auf dem asynchronen Task-Endpunkt von APIXO. Senden Sie Anfragen an generateTask und fragen Sie statusTask ab, oder geben Sie eine Callback-URL für die Webhook-Zustellung an.
Drei Modi werden bereitgestellt: Text-zu-Video, Bild-zu-Video und Referenz-zu-Video. Bild-zu-Video verwendet 1-2 Bilder als erstes und optional letztes Bild; Referenz-zu-Video benötigt mindestens eine Bild- oder Videoreferenz.
Die Ausgabe erfolgt in 768p oder 2K mit einer Länge von 5-15 Sekunden, nur ganze Sekunden. Die Auflösung bestimmt den Preis pro Sekunde. Prompts sind auf 4.000 Zeichen begrenzt. Referenzvideos und -audios sind auf jeweils 3 Dateien begrenzt, mit 2-15 Sekunden pro Datei und insgesamt 15 Sekunden.
„MiniMax H3“ ist die Modell-ID von APIXO. Übernehmen Sie keine Parameterwerte, Qualitätsstufen oder Abrechnungsverhalten von Hailuo 2.3 oder Hailuo 2.3 Fast – es handelt sich um separate Routen mit unterschiedlichen Verträgen.
Referenzen leiten die Erstellung an, garantieren jedoch keine exakte Identität, Typografie, Logos, Materialien oder Produktgeometrie.
Überprüfen Sie vor der Veröffentlichung Anatomie, Hände, Objektkontakt, schnelle Bewegungen, Verdeckung, Kameraübergänge, Sprache und audiovisuelle Synchronisation.
Ja. Das Modell ist live auf dem asynchronen Task-Endpunkt von APIXO verfügbar und kann mit demselben API-Schlüssel wie jedes andere Modell im Katalog aufgerufen werden. Die Erstellung ist auch im Playground auf dieser Seite verfügbar.
Text-zu-Video, Bild-zu-Video und Referenz-zu-Video. Referenz-zu-Video akzeptiert bis zu 9 Bilder, 3 Videos und 3 Audiodateien als kombinierten kreativen Kontext; Audio kann nicht allein bereitgestellt werden.
Ausgabe in 768p oder 2K mit einer Länge von 5 bis 15 Sekunden, nur ganze Sekunden. 2K ist der Standard und die höchste Stufe, die die Route bereitstellt; 768p wird zu einem niedrigeren Preis pro Sekunde abgerechnet. Das Seitenverhältnis kann für Text-zu-Video und Referenz-zu-Video auf 21:9, 16:9, 4:3, 1:1, 3:4 oder 9:16 eingestellt werden; Bild-zu-Video übernimmt den Bildausschnitt vom bereitgestellten ersten Frame.
Das Ausgabevideo wird in jedem Modus pro Sekunde abgerechnet, zum Preis, der Ihrer gewählten Auflösung entspricht – 768p ist pro Sekunde günstiger als 2K. Bei Referenz-zu-Video werden die tatsächlichen Sekunden Ihrer Referenzvideos zum gleichen Preis pro Sekunde abgerechnet. Die ersten 5 Referenzbilder sind kostenlos, jedes weitere Bild wird separat berechnet. Referenz-Audio wird nicht berechnet. Die aktuellen Preise finden Sie im Reiter „Preise“.
Ja. Audio wird im selben Durchgang wie das Bild als natives Stereo erzeugt, wobei Sprache, Soundeffekte, Ambiente und Musik gemeinsam und nicht als separate Spuren modelliert werden.
Nein. Mixed-Media-Referenzen vermitteln die kreative Absicht, garantieren jedoch keine exakte Identität, Bewegung, Stimme, Produktstruktur oder bildgenaue Reproduktion. Der Produktionseinsatz erfordert eine visuelle und auditive Überprüfung.
Entdecken Sie weitere KI-Modelle für Ihren nächsten kreativen Workflow