Sí. APIXO etiqueta y asigna el precio a esta ruta como Kling 3.0 Standard. Es independiente de Kling 3.0 Turbo y Video 3.0 Omni, por lo que su velocidad, características de referencia, controles de edición y precios no se aplican aquí.
Kling Video 3.0 Standard de Kuaishou combina texto a vídeo, animación de imágenes y transferencia de movimiento de personajes en APIXO. Amplía los clips generados a 15 segundos, admite audio nativo opcional y añade prompts a nivel de toma para un mayor control narrativo, mientras que el control de movimiento empareja una imagen de personaje con un vídeo de referencia.
Modos de APIXO
Generar / Animar / Transferir
Precio silencioso
$0.084/sModos de texto e imagen sin sonido generado
Precio del sonido generado
$0.13/sModos de texto e imagen con audio generado
Duración de la generación
3–15 segundos
Lanzado
5 feb 2026
Crear con Kling 3.0 Std
Cargando espacio de trabajo...
Mayor control sobre la narrativa y la continuidad
Duración de escena extendida
Kling Video 3.0 amplía la generación nativa a 15 segundos, dando más espacio a las acciones, diálogos, cambios de cámara y desarrollo de escenas que el máximo de diez segundos de Kling Video 2.6.
Narración con múltiples tomas
Kuaishou diseñó Video 3.0 para interpretar instrucciones de múltiples escenas y tomas, incluyendo cambios de ángulos de cámara, diálogos en plano/contraplano, montaje paralelo y voz en off. APIXO expone segmentos de prompt temporizados opcionales para la generación a partir de texto e imagen.
Mayor consistencia de elementos
La mejora de la consistencia ayuda a que los personajes, objetos, entornos y elementos de marca se mantengan más coherentes entre fotogramas. Los movimientos complejos y las secuencias más largas aún pueden introducir desviaciones visuales y requieren revisión.
Audio nativo multilingüe
Upstream Video 3.0 admite la generación de voz en inglés, chino, japonés, coreano y español, además de acentos en inglés y dialectos chinos. APIXO expone el audio generado a través del control de sonido para los modos basados en texto e imagen.
Mejor conservación del texto
Kuaishou reporta una mejora en la retención y generación de texto visible como señalización, subtítulos, logotipos y ropa de marca. La ortografía y la ubicación exactas deben verificarse antes de su uso comercial.
Actuación fotorrealista
Video 3.0 mejora el resultado fotorrealista para personajes expresivos y actuaciones dinámicas. Los prompts detallados pueden coordinar el comportamiento del sujeto, la dirección de la cámara, la progresión de la escena y el sonido dentro de una misma secuencia generada.
Genere una nueva escena o transfiera un movimiento existente
Generación de texto e imagen
Cree a partir de un prompt o anime una o dos imágenes durante 3-15 segundos. Elija entre sonido generado o salida silenciosa y, opcionalmente, divida el clip en segmentos de prompt cronometrados para una dirección a nivel de toma.
Control de movimiento de personajes
Combine exactamente una imagen de personaje con un vídeo de movimiento de referencia. Elija si la orientación sigue a la imagen o al vídeo; la duración proviene del clip de referencia, y la configuración de sonido determina si se conserva su audio original.
Kling 3.0 Standard en APIXO
Controles específicos del flujo de trabajo para generación y transferencia de movimiento.
1:1 / 9:16 / 16:9
Relaciones de aspecto de texto a vídeo
1–2 imágenes
Imagen a vídeo
1 imagen + 1 vídeo
Control de movimiento
Hasta 30 segundos
Referencia de movimiento
JPG / JPEG / PNG
Formatos de imagen
1 URL de MP4
Salida de APIXO
Desarrolle historias, actuaciones y contenido de marca en movimiento
Prototipos de escenas multitoma
Estructure un clip generado más largo con segmentos de prompt cronometrados para planos de establecimiento, primeros planos, reacciones y transiciones. Use el resultado para probar el ritmo narrativo, los cambios de cámara, el flujo de diálogo y la lógica de la escena antes de la producción.
Transferencia de actuación de referencia
Aplique el movimiento de un vídeo de referencia corto a la imagen de un personaje para estudios de actuación, pruebas de coreografía o animación estilizada. Seleccione la orientación según si la dirección del cuerpo debe seguir la imagen de origen o el metraje de movimiento.
Campañas audiovisuales de marca
Cree exhibiciones de productos, anuncios narrados y campañas sociales cortas con voz, música, ambiente y efectos nativos opcionales. Revise la geometría del producto, el texto visible, los logotipos, la redacción vocal y la sincronización antes de publicar.
Conceptos de conversación multilingüe
Cree prototipos de conversaciones, entrevistas y escenas multilingües utilizando las capacidades de voz nativas de Kling Video 3.0. Especifique claramente cada interlocutor, idioma, orden, tono y acción, y luego verifique la atribución, pronunciación, movimiento de labios y continuidad.
Aplicar las reglas correctas de sonido y duración
Restricciones de APIXO
Los modos de texto a vídeo e imagen a vídeo aceptan una duración de 3 a 15 segundos; el control de movimiento ignora ese campo.
El servicio de imagen a vídeo acepta una imagen de inicio y, opcionalmente, una segunda imagen que puede guiar el fotograma final.
El control de movimiento requiere exactamente una imagen de personaje y un vídeo público de referencia de no más de 30 segundos.
La selección de la relación de aspecto solo se aplica a la generación de texto a vídeo a través de APIXO.
APIXO no expone aquí un modo separado para audio subido, extensión de vídeo, edición de vídeo o múltiples referencias arbitrarias.
Las integraciones de producción pueden recuperar resultados asíncronos mediante sondeo (polling) o una devolución de llamada (callback) HTTPS pública.
Preguntas sobre Kling 3.0 Standard
La conversión de texto a vídeo e imagen a vídeo cuesta $0.084 por segundo generado con el sonido desactivado o $0.13 por segundo con el sonido activado. Su duración facturable es el valor seleccionado entre 3 y 15 segundos.
APIXO cobra el control de movimiento a $0.13 por cada segundo detectado del vídeo de referencia, con un mínimo de tres segundos facturables. El campo de duración enviado se ignora y los vídeos de referencia de más de 30 segundos se rechazan.
Para texto a vídeo e imagen a vídeo, sound: true solicita audio generado por el modelo y false produce una salida silenciosa. En el control de movimiento, el mismo campo determina si se conserva el audio original del vídeo de referencia en lugar de solicitar audio nuevo.
Compruebe la identidad, la anatomía, las manos, el contacto con objetos, el texto incrustado, la lógica de las transiciones, el movimiento rápido, la atribución del hablante, la precisión del diálogo, la pronunciación y la sincronización labial. Las escenas más largas o con múltiples tomas crean más oportunidades de derivas temporales y del personaje.
Explorar otros modelos
Descubra más modelos de IA para su próximo flujo de trabajo creativo