Sì. APIXO etichetta e prezza questa opzione come Kling 3.0 Standard. È distinta da Kling 3.0 Turbo e Video 3.0 Omni, pertanto la loro velocità, le funzionalità di riferimento, i controlli di modifica e i prezzi non devono essere applicati in questo caso.
Kling Video 3.0 Standard di Kuaishou combina su APIXO la generazione da testo a video, l'animazione di immagini e il trasferimento del movimento del personaggio. Estende le clip generate a 15 secondi, supporta l'audio nativo opzionale e aggiunge prompt a livello di inquadratura per un maggiore controllo narrativo, mentre il controllo del movimento abbina un'immagine del personaggio a un video di performance di riferimento.
Modalità APIXO
Genera / Anima / Trasferisci
Prezzo Silenzioso
$0.084/secModalità testo e immagine senza audio generato
Prezzo Audio Generato
$0.13/secModalità testo e immagine con audio generato
Durata della generazione
3–15 secondi
Rilasciato
5 feb 2026
Crea con Kling 3.0 Std
Caricamento dell'area di lavoro...
Maggiore controllo su narrazione e continuità
Durata della Scena Estesa
Kling Video 3.0 estende la generazione nativa a 15 secondi, offrendo più spazio per azioni, dialoghi, cambi di camera e sviluppo della scena rispetto al massimo di dieci secondi di Kling Video 2.6.
Storytelling a Più Inquadrature
Kuaishou ha progettato Video 3.0 per interpretare istruzioni multi-scena e multi-inquadratura, inclusi cambi di angolazione della camera, dialoghi in campo-controcampo, montaggio incrociato e voce fuori campo. APIXO espone segmenti di prompt temporizzati opzionali per la generazione guidata da testo e immagini.
Maggiore coerenza degli elementi
La coerenza migliorata aiuta a mantenere personaggi, oggetti, ambienti ed elementi brandizzati più coerenti tra i fotogrammi. Movimenti complessi e sequenze più lunghe possono ancora introdurre derive visive e richiedere una revisione.
Audio Nativo Multilingue
Upstream Video 3.0 supporta la sintesi vocale in inglese, cinese, giapponese, coreano e spagnolo, oltre ad accenti inglesi e dialetti cinesi. APIXO espone l'audio generato tramite il controllo del suono per le modalità basate su testo e immagine.
Migliore Conservazione del Testo
Kuaishou riporta un miglioramento nella conservazione e generazione di testo visibile come insegne, didascalie, loghi e abbigliamento brandizzato. L'ortografia e il posizionamento esatti dovrebbero comunque essere controllati prima dell'uso commerciale.
Performance Fotorealistica
Video 3.0 migliora l'output fotorealistico per personaggi espressivi e performance dinamiche. Prompt dettagliati possono coordinare il comportamento del soggetto, la direzione della telecamera, la progressione della scena e l'audio all'interno di un'unica sequenza generata.
Genera una nuova scena o trasferisci un movimento esistente
Generazione di testo e immagini
Crea da un prompt o anima una o due immagini per 3-15 secondi. Scegli un audio generato o un output silenzioso e, facoltativamente, dividi la clip in segmenti di prompt temporizzati per una regia a livello di inquadratura.
Controllo del Movimento del Personaggio
Combina esattamente un'immagine del personaggio con un video di movimento di riferimento. Scegli se l'orientamento segue l'immagine o il video; la durata deriva dalla clip di riferimento e l'impostazione audio determina se l'audio originale viene mantenuto.
Kling 3.0 Standard su APIXO
Controlli specifici del flusso di lavoro per la generazione e il trasferimento del movimento.
1:1 / 9:16 / 16:9
Rapporti d'aspetto per testo a video
1–2 immagini
Immagine a video
1 immagine + 1 video
Controllo movimento
Fino a 30 secondi
Riferimento di Movimento
JPG / JPEG / PNG
Formati immagine
1 URL MP4
Output APIXO
Sviluppa storie, performance e motion design brandizzato
Prototipi di Scene Multi-Inquadratura
Strutturi una clip generata più lunga con segmenti di prompt temporizzati per campi lunghi, primi piani, reazioni e transizioni. Utilizzi il risultato per testare il ritmo narrativo, i cambi di telecamera, il flusso dei dialoghi e la logica della scena prima della produzione.
Trasferimento Performance di Riferimento
Applica il movimento di un breve video di riferimento a un'immagine del personaggio per studi di performance, test coreografici o animazioni stilizzate. Seleziona l'orientamento a seconda che la direzione del corpo debba seguire l'immagine di origine o il filmato del movimento.
Campagne Audiovisive Brandizzate
Crea vetrine di prodotti, pubblicità narrate e brevi campagne social con parlato nativo, musica, ambiente ed effetti opzionali. Controlla la geometria del prodotto, il testo visibile, i loghi, il testo vocale e la sincronizzazione prima della pubblicazione.
Concept di Conversazioni Multilingue
Prototipare conversazioni, interviste e scene interlinguistiche utilizzando le capacità vocali native di Kling Video 3.0. Specificare chiaramente ogni interlocutore, lingua, ordine, tono e azione, quindi verificare attribuzione, pronuncia, movimento delle labbra e continuità.
Applica le regole corrette per audio e durata
Vincoli di APIXO
Le modalità da testo a video e da immagine a video accettano una durata di 3–15 secondi; il controllo del movimento ignora questo campo.
La generazione da immagine a video accetta un'immagine di partenza e, opzionalmente, una seconda immagine che può guidare il fotogramma finale.
Il controllo del movimento richiede esattamente un'immagine del personaggio e un video di riferimento pubblico non più lungo di 30 secondi.
La selezione del rapporto d'aspetto si applica solo al testo a video tramite APIXO.
APIXO non espone qui modalità separate per audio caricato, estensione video, editing video o multi-riferimento arbitrario.
Le integrazioni in produzione possono recuperare i risultati in modo asincrono tramite polling o un callback HTTPS pubblico.
Domande su Kling 3.0 Standard
Le generazioni da testo a video e da immagine a video costano $0.084 per secondo generato con audio disabilitato o $0.13 per secondo con audio abilitato. La loro durata fatturabile è il valore selezionato tra 3 e 15 secondi.
APIXO addebita il controllo del movimento a $0.13 per ogni secondo rilevato nel video di riferimento, con un minimo di tre secondi fatturabili. Il campo della durata inviato viene ignorato e i video di riferimento più lunghi di 30 secondi vengono rifiutati.
Per testo a immagine e immagine a video, sound: true richiede l'audio generato dal modello e false produce un output silenzioso. Nel controllo del movimento, lo stesso campo determina se l'audio originale del video di riferimento viene mantenuto anziché richiedere un audio generato ex novo.
Verifica identità, anatomia, mani, contatto con oggetti, testo incorporato, logica delle transizioni, movimenti rapidi, attribuzione del parlato, accuratezza dei dialoghi, pronuncia e sincronizzazione labiale. Scene più lunghe o con più inquadrature creano maggiori opportunità di deriva temporale e del personaggio.
Esplora altri modelli
Scopri altri modelli AI per il tuo prossimo workflow creativo