Cette page couvre la version de recherche originale d'InfiniteTalk de MeiGen-AI, publiée avec son rapport technique, son code et les poids du modèle le 19 août 2025. Elle ne décrit pas LongCat Video Avatar, les checkpoints communautaires ou d'autres systèmes d'avatars non liés.
InfiniteTalk est le modèle vidéo de personne audio-dirigé de MeiGen-AI pour synchroniser la parole avec l'expression faciale, les mouvements de la tête et la posture du corps, et pas seulement la bouche. APIXO fournit un workflow axé sur le portrait et l'audio avec un masque optionnel, jusqu'à dix minutes d'audio, une sortie en 480p ou 720p, et une livraison asynchrone.
Entrées APIXO
Portrait + audio
Prix APIXO
À partir de $0.03 / seconde480p, minimum de cinq secondes
Résolution APIXO
480p / 720p
Limite audio
Jusqu'à 600 secondes
Publié le
19 août 2025
Créer avec InfiniteTalk
Chargement de l'espace de travail...
L'audio pilote la performance humaine globale
Mouvement synchronisé avec la parole
InfiniteTalk utilise l'audio pour coordonner les mouvements de la bouche avec l'expression, les mouvements de la tête et la posture du corps. La synchronisation labiale est un objectif principal, bien que la précision puisse encore varier en fonction de la vitesse de la parole, de la pose et de la qualité de la source.
Continuité des séquences longues
Le framework en amont d'InfiniteTalk utilise le contexte temporel entre les segments générés pour prendre en charge des séquences audio-dirigées plus longues. APIXO accepte des fichiers audio jusqu'à 600 secondes, bien que les résultats longs doivent toujours être examinés pour la dérive d'identité et la cohérence des transitions.
Du portrait à la performance
L'implémentation d'APIXO part d'une seule image de portrait plutôt que d'une description textuelle du personnage. La source établit l'identité visuelle du sujet, ses vêtements, la composition et l'arrière-plan avant que le mouvement piloté par l'audio ne soit synthétisé.
Performance parlée et chantée
Animez le portrait avec un discours, un dialogue, une narration ou un chant finalisés. Le rythme vocal, l'émotion, la prononciation et l'élocution proviennent de l'enregistrement fourni plutôt que d'un système de synthèse vocale intégré à ce point de terminaison.
Entrée audio longue
APIXO accepte un fichier audio d'une durée maximale de 600 secondes. Cela rend le point de terminaison adapté à des contenus plus longs qu'un clip d'avatar court conventionnel, bien que le temps de traitement et les exigences de cohérence augmentent avec la durée.
Itération reproductible
Choisissez une sortie en 480p ou 720p et fournissez éventuellement un seed APIXO. Un seed fixe permet une expérimentation contrôlée, mais ne garantit pas des résultats identiques si les entrées ou les versions du fournisseur changent.
Contrôles InfiniteTalk via APIXO
Limites publiques pour le flux de travail dédié aux portraits et à l'audio.
1 portrait + masque optionnel
Images en entrée
1 URL audio
Nombre d'audios
MP3 / WAV / M4A
Formats audio
128 MB
Taille limite de l'audio
5 secondes
Facturation minimale
Asynchrone / Callback
Livraison
Créer du contenu oral à partir d'un audio préparé
Vidéos de présentateurs et porte-paroles
Associez un portrait préparé avec une parole enregistrée ou synthétisée pour créer du contenu de type présentateur. Le point de terminaison anime la performance audio fournie ; il ne rédige pas de script ni ne génère de parole à partir de texte.
Versions marketing localisées
Réutilisez un portrait approuvé avec des pistes vocales produites séparément pour les versions régionales de campagnes. InfiniteTalk réagit à la performance acoustique plutôt qu'à une langue déclarée, mais la prononciation et la synchronisation doivent être vérifiées pour chaque enregistrement.
Leçons et modules de formation
Convertissez une narration en vidéos d'instructeur, de guide ou d'avatar de cours en 480p ou 720p. La limite audio de dix minutes d'APIXO prend en charge les explications plus longues, tandis que les modules complexes peuvent toujours être divisés en segments plus courts pour un contrôle qualité plus facile.
Parole et chant des personnages
Animez un portrait de personnage approprié à partir d'un dialogue, d'une narration ou d'un audio de chant. Les sources fortement stylisées, non humaines, en pied ou avec plusieurs personnes ne font pas l'objet de garanties APIXO documentées et doivent être testées avant de s'engager dans un format de production.
Préparer le portrait, l'audio et le canal de livraison
Des ressources sources propres réduisent les problèmes de synchronisation et d'identité évitables.
Préparer un portrait net
Choisissez un sujet visible unique avec un visage clair, une occlusion limitée et une qualité d'image suffisante. Conservez le cadrage et l'arrière-plan prévus dans la source, car APIXO n'expose pas de contrôles de format d'image ou de caméra.
Téléverser l'audio final
Fournissez une URL publique de fichier MP3, WAV ou M4A respectant les limites de 128 Mo et 600 secondes. Complétez la transcription, la traduction, la génération de voix, le nettoyage et le timing avant de soumettre la piste.
Générer et examiner le mouvement
Sélectionnez 480p ou 720p, soumettez la tâche asynchrone et récupérez le résultat par interrogation (polling) ou via un rappel (callback). Vérifiez la bouche, les dents, les yeux, les mains, la pose, l'identité et les transitions de segments avant de publier.
Comprendre ce qu'APIXO expose
Contraintes importantes
APIXO expose un mode image vers vidéo nécessitant un portrait et un fichier audio pour l'animer.
Le schéma de requête publié par APIXO marque le prompt comme requis ; soumettez une instruction de mouvement claire avec chaque requête de production.
La facturation est basée sur la durée audio détectée ou sur cinq secondes, la valeur la plus élevée étant retenue.
Un audio plus long augmente le temps de traitement ; la livraison par callback est préférable pour les tâches de production longues.
APIXO n'expose pas publiquement les contrôles pour l'entrée vidéo, le format d'image, la fréquence d'images ou le format de sortie.
N'utilisez les portraits et les voix que si vous disposez des droits, consentements et autorisations nécessaires.
Questions sur InfiniteTalk
Pas via le schéma infinitetalk publiquement documenté. La recherche en amont supporte le doublage vidéo-vers-vidéo piloté par l'audio, mais APIXO expose un flux de travail image-vers-vidéo de portrait et audio sans champ pour la vidéo source.
Non. APIXO requiert un fichier audio téléversé, et cet enregistrement pilote la performance résultante. Utilisez un système d'enregistrement ou de synthèse vocale distinct pour créer l'audio parlé ou chanté avant d'appeler InfiniteTalk.
L'audio téléversé anime la performance, et APIXO sonde sa durée pour la facturation, jusqu'à 600 secondes. Il n'y a pas de contrôle de durée séparé. Tenez compte des éventuelles différences de traitement ou d'encodage lors de la validation de la durée finale de la vidéo.
Les visages masqués, les poses extrêmes, la parole rapide, un audio peu clair, les mains visibles près du visage, plusieurs personnes et les portraits de faible qualité peuvent augmenter les erreurs de synchronisation ou la dérive visuelle. Les résultats longs doivent être examinés pour la cohérence de l'identité et la cohérence temporelle.
Explorer d'autres modèles
Découvrez d'autres modèles d'IA pour votre prochain workflow créatif