Ja. APIXO kennzeichnet und bepreist diese Route als Kling 3.0 Standard. Sie ist getrennt von Kling 3.0 Turbo und Video 3.0 Omni, daher sollten deren Geschwindigkeit, Referenzfunktionen, Bearbeitungssteuerungen und Preise hier nicht angewendet werden.
Kling 3.0 Std
Kuaishous Kling Video 3.0 Standard kombiniert Text-zu-Video, Bildanimation und Charakterbewegungsübertragung auf APIXO. Es verlängert erstellte Clips auf 15 Sekunden, unterstützt optional nativen Ton und fügt Prompting auf Aufnahmeebene für eine stärkere narrative Kontrolle hinzu, während die Bewegungssteuerung ein Charakterbild mit einem Referenz-Performance-Video kombiniert.
APIXO-Modi
Erstellen / Animieren / Übertragen
Preis (stumm)
$0.084/Sek.Text- und Bildmodi ohne erstellten Ton
Preis für erstellten Sound
$0.13/Sek.Text- und Bildmodi mit erstelltem Audio
Generierungslänge
3–15 Sekunden
Veröffentlicht
5. Feb. 2026
Mit Kling 3.0 Std erstellen
Arbeitsbereich wird geladen...
Mehr Kontrolle über Erzählung und Kontinuität
Verlängerte Szenendauer
Kling Video 3.0 erweitert die native Erstellung auf 15 Sekunden und bietet damit mehr Raum für Handlungen, Dialoge, Kamerawechsel und Szenenentwicklung als die maximale Dauer von zehn Sekunden bei Kling Video 2.6.
Multi-Shot-Storytelling
Kuaishou hat Video 3.0 so konzipiert, dass es Anweisungen für mehrere Szenen und Aufnahmen interpretieren kann, einschließlich wechselnder Kamerawinkel, Schuss-Gegenschuss-Dialoge, Cross-Cutting und Voice-Over. APIXO stellt optionale, zeitgesteuerte Prompt-Segmente für die text- und bildgesteuerte Erstellung zur Verfügung.
Stärkere Elementkonsistenz
Eine verbesserte Konsistenz sorgt dafür, dass Charaktere, Objekte, Umgebungen und Markenelemente über mehrere Frames hinweg kohärenter bleiben. Komplexe Bewegungen und längere Sequenzen können dennoch zu visuellen Abweichungen führen und erfordern eine Überprüfung.
Mehrsprachiger nativer Ton
Upstream Video 3.0 unterstützt erstellte Sprache in Englisch, Chinesisch, Japanisch, Koreanisch und Spanisch, sowie englische Akzente und chinesische Dialekte. APIXO stellt erstelltes Audio über die Sound-Steuerung für text- und bildgesteuerte Modi zur Verfügung.
Bessere Texterhaltung
Kuaishou berichtet von einer verbesserten Beibehaltung und Erstellung von sichtbarem Text wie Beschilderungen, Untertiteln, Logos und Markenkleidung. Die exakte Schreibweise und Platzierung sollte vor der kommerziellen Nutzung dennoch überprüft werden.
Fotorealistische Performance
Video 3.0 verbessert die fotorealistische Ausgabe für ausdrucksstarke Charaktere und dynamische Darbietungen. Detaillierte Prompts können das Verhalten von Subjekten, die Kameraführung, den Szenenverlauf und den Ton innerhalb einer erstellten Sequenz koordinieren.
Neue Szene erstellen oder vorhandene Bewegung übertragen
Text- und Bilderstellung
Erstellen Sie aus einem Prompt oder animieren Sie ein bis zwei Bilder für 3–15 Sekunden. Wählen Sie zwischen erstelltem Sound oder einer stillen Ausgabe und teilen Sie den Clip optional in zeitgesteuerte Prompt-Segmente für eine regieähnliche Steuerung auf.
Charakter-Bewegungssteuerung
Kombinieren Sie genau ein Charakterbild mit einem Referenz-Bewegungsvideo. Wählen Sie, ob die Ausrichtung dem Bild oder dem Video folgt; die Dauer wird vom Referenzclip übernommen, und die Sound-Einstellung bestimmt, ob dessen Originalton beibehalten wird.
Kling 3.0 Standard auf APIXO
Workflow-spezifische Steuerungen für Erstellung und Bewegungsübertragung.
1:1 / 9:16 / 16:9
Text-zu-Video Seitenverhältnisse
1–2 Bilder
Bild-zu-Video
1 Bild + 1 Video
Bewegungssteuerung
Bis zu 30 Sekunden
Bewegungsreferenz
JPG / JPEG / PNG
Bildformate
1 MP4-URL
APIXO-Ausgabe
Entwickeln Sie Storys, Performances und Marken-Motion-Graphics
Multi-Shot-Szenenprototypen
Strukturieren Sie einen längeren erstellten Clip mit zeitlich abgestimmten Prompt-Segmenten für Establishing Shots, Nahaufnahmen, Reaktionen und Übergänge. Verwenden Sie das Ergebnis, um den narrativen Rhythmus, Kamerawechsel, den Dialogfluss und die Szenenlogik vor der Produktion zu testen.
Übertragung der Referenz-Performance
Übertragen Sie Bewegungen von einem kurzen Referenzvideo auf ein Charakterbild für Performance-Studien, Choreografie-Tests oder stilisierte Animationen. Wählen Sie die Ausrichtung je nachdem, ob die Körperrichtung dem Quellbild oder dem Bewegungsmaterial folgen soll.
Audiovisuelle Markenkampagnen
Erstellen Sie Produktpräsentationen, vertonte Werbespots und kurze Social-Media-Kampagnen mit optionaler nativer Sprache, Musik, Ambiente und Effekten. Überprüfen Sie vor der Veröffentlichung die Produktgeometrie, sichtbaren Text, Logos, den gesprochenen Text und die Synchronisation.
Mehrsprachige Konversationskonzepte
Erstellen Sie Prototypen für Konversationen, Interviews und sprachübergreifende Szenen mit den nativen Sprachfunktionen von Kling Video 3.0. Geben Sie jeden Sprecher, jede Sprache, Reihenfolge, Tonlage und Handlung klar an und überprüfen Sie anschließend Zuordnung, Aussprache, Lippenbewegung und Kontinuität.
Korrekte Sound- und Dauer-Regeln anwenden
APIXO-Einschränkungen
Text-zu-Video und Bild-zu-Video akzeptieren eine Dauer von 3–15 Sekunden; die Bewegungssteuerung ignoriert dieses Feld.
Bild-zu-Video akzeptiert ein Startbild und optional ein zweites Bild, das den End-Frame steuern kann.
Die Bewegungssteuerung erfordert genau ein Charakterbild und ein öffentliches Referenzvideo von nicht mehr als 30 Sekunden Länge.
Die Auswahl des Seitenverhältnisses gilt nur für Text-zu-Video über APIXO.
APIXO stellt hier keinen separaten Modus für hochgeladenes Audio, Videoerweiterung, Videobearbeitung oder beliebige Multi-Referenzen zur Verfügung.
Produktionsintegrationen können asynchrone Ergebnisse durch Polling oder einen öffentlichen HTTPS-Callback abrufen.
Fragen zu Kling 3.0 Standard
Text-zu-Video und Bild-zu-Video kosten $0.084 pro erstellter Sekunde bei deaktiviertem Ton oder $0.13 pro Sekunde bei aktiviertem Ton. Die abrechenbare Dauer ist der gewählte Wert zwischen 3 und 15 Sekunden.
APIXO berechnet die Bewegungssteuerung mit $0.13 pro erkannter Sekunde des Referenzvideos, bei einem Minimum von drei abrechenbaren Sekunden. Das übermittelte Feld für die Dauer wird ignoriert und Referenzvideos, die länger als 30 Sekunden sind, werden abgelehnt.
Bei Text-zu-Video und Bild-zu-Video fordert sound: true vom Modell erstelltes Audio an und false erzeugt eine stille Ausgabe. Bei der Bewegungssteuerung bestimmt dasselbe Feld, ob das Originalaudio des Referenzvideos beibehalten wird, anstatt neu erstelltes Audio anzufordern.
Überprüfen Sie Identität, Anatomie, Hände, Objektkontakt, eingebetteten Text, Übergangslogik, schnelle Bewegungen, Sprecherzuordnung, Dialoggenauigkeit, Aussprache und Lippensynchronisation. Längere Szenen oder solche mit mehreren Einstellungen schaffen mehr Möglichkeiten für zeitliche und charakterliche Abweichungen.
Weitere Modelle entdecken
Entdecken Sie weitere KI-Modelle für Ihren nächsten kreativen Workflow