Да. APIXO маркирует и оценивает этот маршрут как Kling 3.0 Standard. Он отделен от Kling 3.0 Turbo и Video 3.0 Omni, поэтому их скорость, референсные функции, элементы управления редактированием и цены здесь не применяются.
Kling Video 3.0 Standard от Kuaishou в APIXO объединяет генерацию "текст в видео", анимацию изображений и перенос движения персонажа. Модель увеличивает длину генерируемых клипов до 15 секунд, поддерживает опциональный нативный звук и добавляет покадровые промпты для лучшего контроля над повествованием, в то время как управление движением использует одно изображение персонажа и одно референсное видео с движением.
Режимы APIXO
Сгенерировать / Анимировать / Перенести
Цена без звука
$0.084/секРежимы текста и изображений без генерации звука
Цена за сгенерированный звук
$0.13/секРежимы текста и изображений с генерацией аудио
Продолжительность генерации
3–15 секунд
Выпущен
5 фев. 2026 г.
Создать с Kling 3.0 Std
Загрузка рабочего пространства...
Больше контроля над повествованием и непрерывностью
Увеличенная длительность сцены
Kling Video 3.0 увеличивает длительность нативной генерации до 15 секунд, предоставляя больше времени для действий, диалогов, смены ракурсов и развития сцены по сравнению с десятисекундным максимумом Kling Video 2.6.
Многосценарное повествование
Kuaishou разработала Video 3.0 для интерпретации инструкций с несколькими сценами и кадрами, включая смену ракурсов камеры, диалоги со сменой плана, перекрёстный монтаж и закадровый голос. APIXO предоставляет опциональные временные сегменты промптов для генерации на основе текста и изображений.
Повышенная согласованность элементов
Улучшенная согласованность помогает персонажам, объектам, окружению и элементам брендинга оставаться более целостными в разных кадрах. Сложные движения и длинные последовательности всё же могут приводить к визуальным искажениям и требуют проверки.
Многоязычный нативный звук
Upstream Video 3.0 поддерживает синтез речи на английском, китайском, японском, корейском и испанском языках, а также английские акценты и китайские диалекты. APIXO предоставляет доступ к сгенерированному аудио через управление звуком для режимов с исходным текстом или изображением.
Лучшее сохранение текста
Kuaishou сообщает об улучшенном сохранении и генерации видимого текста, такого как вывески, подписи, логотипы и брендированная одежда. Точность написания и расположения всё же следует проверять перед коммерческим использованием.
Фотореалистичное исполнение
Video 3.0 улучшает фотореалистичность для выразительных персонажей и динамичных сцен. Подробные промпты могут координировать поведение объекта, направление камеры, развитие сцены и звук в рамках одной сгенерированной последовательности.
Сгенерируйте новую сцену или перенесите существующее движение
Генерация текста и изображений
Создайте видео из промпта или анимируйте одно-два изображения длительностью 3–15 секунд. Выберите сгенерированный звук или вывод без звука и, при необходимости, разделите клип на сегменты с промптами для покадрового управления.
Управление движением персонажа
Объедините ровно одно изображение персонажа с одним референсным видео движения. Выберите, будет ли ориентация следовать изображению или видео; длительность берётся из референсного ролика, а настройка звука определяет, сохранится ли его оригинальная аудиодорожка.
Kling 3.0 Standard в APIXO
Специальные элементы управления для генерации и переноса движения в зависимости от рабочего процесса.
1:1 / 9:16 / 16:9
Соотношения сторон для видео
1–2 изображения
Изображение в видео
1 изображение + 1 видео
Управление движением
До 30 секунд
Референс движения
JPG / JPEG / PNG
Форматы изображений
1 URL на MP4-файл
Вывод APIXO
Разрабатывайте истории, перформансы и брендированный видеоконтент
Прототипы многокадровых сцен
Структурируйте длинные видео с помощью промпт-сегментов с таймингом для общих планов, крупных планов, реакций и переходов. Используйте результат для проверки ритма повествования, смены ракурсов, течения диалога и логики сцены перед началом производства.
Перенос референсного движения
Примените движение из короткого референсного видео к изображению персонажа для изучения актёрской игры, тестирования хореографии или создания стилизованной анимации. Выберите ориентацию в зависимости от того, должно ли направление тела следовать исходному изображению или видео с движением.
Брендированные аудиовизуальные кампании
Создавайте демонстрации продуктов, рекламные ролики с озвучкой и короткие кампании для соцсетей с опциональной нативной речью, музыкой, эмбиентом и эффектами. Перед публикацией проверьте геометрию продукта, видимый текст, логотипы, озвученные фразы и синхронизацию.
Концепции многоязычных диалогов
Создавайте прототипы диалогов, интервью и межъязыковых сцен, используя нативные голосовые возможности Kling Video 3.0. Чётко указывайте каждого говорящего, язык, порядок, тон и действие, а затем проверяйте атрибуцию, произношение, движение губ и целостность.
Примените правильные правила для звука и длительности
Ограничения APIXO
Генерация из текста в видео и из изображения в видео поддерживает продолжительность 3–15 секунд; управление движением игнорирует это поле.
API для "изображение в видео" принимает одно исходное изображение и опциональное второе изображение, которое может служить ориентиром для конечного кадра.
Для управления движением требуется ровно одно изображение персонажа и одно публичное референсное видео длительностью не более 30 секунд.
Выбор соотношения сторон применяется только к генерации «текст в видео» через APIXO.
В данном режиме APIXO не предоставляет отдельных функций для загрузки аудио, расширения видео, видеомонтажа или использования нескольких референсов.
Продакшн-интеграции могут получать асинхронные результаты через опросы или публичный HTTPS-коллбэк.
Вопросы о Kling 3.0 Standard
Стоимость генерации «текст в видео» и «изображение в видео» составляет $0.084 за секунду с отключённым звуком или $0.13 за секунду с включённым звуком. Тарифицируемая длительность — выбранное значение от 3 до 15 секунд.
APIXO взимает плату за управление движением (motion control) по $0.13 за каждую секунду обнаруженного референсного видео, с минимальной тарификацией в три секунды. Указанное в запросе поле длительности игнорируется, а референсные видео длиннее 30 секунд отклоняются.
Для text-to-video и image-to-video параметр sound: true запрашивает генерацию звука моделью, а false создаёт видео без звука. В режиме управления движением этот же параметр определяет, сохраняется ли оригинальный звук из референсного видео, а не запрашивается ли генерация нового.
Проверяйте идентичность, анатомию, руки, контакт с объектами, встроенный текст, логику переходов, быстрые движения, атрибуцию говорящего, точность диалогов, произношение и синхронизацию губ. Более длинные сцены или сцены с несколькими кадрами создают больше возможностей для расхождений во времени и с персонажем.
Другие модели
Откройте для себя больше AI-моделей для вашего следующего творческого процесса