本页面介绍的是由 MeiGen-AI 发布的 InfiniteTalk 原始研究版本,其技术报告、代码和模型权重已于 2025 年 8 月 19 日公布。本页内容不涉及 LongCat Video Avatar、社区微调模型或其它无关的数字人系统。
InfiniteTalk
InfiniteTalk 是美图奇想(MeiGen-AI)的音频驱动数字人视频模型,可将语音与面部表情、头部动作和身体姿态同步,而不仅仅是嘴部动作。APIXO 提供了聚焦于肖像和音频的工作流,支持可选遮罩、最长十分钟的驱动音频、480p 或 720p 分辨率输出以及异步交付。
APIXO 输入项
肖像 + 音频
APIXO 价格
每秒 $0.03 起480p,最低 5 秒
APIXO 分辨率
480p / 720p
音频限制
最长 600 秒
发布于
2025年8月19日
使用 InfiniteTalk 创作
正在加载工作区...
音频驱动更全面的真人表演
语音同步动态
InfiniteTalk 使用驱动音频来协调嘴部动作与表情、头部运动和身体姿态。口型同步是其核心目标,但其准确性仍可能因语速、姿势和源文件质量而异。
长序列连贯性
InfiniteTalk 的上游框架利用生成片段之间的时间上下文来支持更长的音频驱动序列。APIXO 接受最长 600 秒的驱动音频,但对于长视频输出,仍应检查是否存在人物特征偏离和过渡连贯性问题。
从肖像到视频
APIXO 的实现从一张肖像图开始,而非纯文本的角色描述。源图片在合成音频驱动的动作之前,就已确立了主体的视觉身份、服装、构图和背景。
语音和歌唱表现
使用已完成的演讲、对话、旁白或歌唱音频来驱动肖像。声音的节奏、情感、发音和表达方式均来自您提供的录音,而非此接口地址内置的文字转语音系统。
长音频输入
APIXO 支持最长 600 秒的单个音频文件。这使得该路径适用于比传统短头像视频更长的素材,但处理时间和一致性要求会随着长度增加而提高。
可复现的迭代
选择 480p 或 720p 输出,并可选择性地提供一个 APIXO 种子值。固定的种子值有助于进行受控实验,但不能保证在输入内容或提供商版本变更时产生完全相同的结果。
通过 APIXO 使用 InfiniteTalk
专属人像与音频工作流的公共限制。
1 张肖像图 + 可选遮罩
图像输入
1 个音频 URL
音频数量
MP3 / WAV / M4A
音频格式
128 MB
音频大小限制
5 秒
最低计费
异步 / 回调
交付
根据准备好的音频创建口播内容
演示者与发言人视频
将准备好的肖像图与录制或合成的语音配对,以创建演示风格的内容。该接口地址会根据您提供的音频生成动画;它不会编写脚本或从文本生成语音。
本地化营销内容
针对不同区域的营销活动,可复用已批准的人像并搭配独立制作的音轨。InfiniteTalk 会根据音频本身的声学表现生成动画,而非声明的语种,但每次录制都应检查发音和同步效果。
课程与训练模块
将旁白转换为 480p 或 720p 分辨率的讲师、向导或课程虚拟形象视频。APIXO 的十分钟音频限制支持较长的解说,而复杂的模块仍可被划分为更短的片段,以便于质量控制。
角色语音与歌唱
根据对话、旁白或歌唱音频,为合适的人物肖像生成动画。请注意,APIXO 不保证对风格化过强、非人类、全身或多人物的源素材提供稳定支持,建议在投入正式制作前进行测试。
准备肖像图、音频和交付路径
干净的源素材可减少可避免的同步和身份识别问题。
准备一张清晰的肖像图
选择一个面部清晰、遮挡少、图像质量足够高的单一可见主体。请在源图片中保持预期的构图和背景,因为 APIXO 未提供宽高比或相机控制选项。
上传已完成的语音音频
提供一个公开的 MP3、WAV 或 M4A URL,文件大小须在 128 MB 以内,时长不超过 600 秒。在提交音轨前,请完成转录、翻译、语音生成、清理和时间对齐等工作。
生成并审核动态效果
选择 480p 或 720p 分辨率,提交异步任务,然后通过轮询或回调接收结果。在发布前,请检查最终视频的口型、牙齿、眼睛、手部、姿势、身份一致性以及片段过渡效果。
了解 APIXO 提供的功能
重要限制
APIXO 提供一种图生视频模式,需要一张肖像图和一个驱动音频文件。
APIXO 发布的请求 schema 将提示词标记为必需项;请在每次生成请求中提交清晰的运动指令。
计费按检测到的音频时长或 5 秒计算,以较长者为准。
音频越长,处理时间也越长;对于长时间的生产任务,建议使用回调方式交付。
APIXO 未公开暴露视频输入、宽高比、帧率或输出格式的控制选项。
请确保您拥有必要的权利、许可和授权,方可使用相关人像和声音。
InfiniteTalk 常见问题
无法通过 APIXO 公开的 infinitetalk schema 实现。上游研究支持音频驱动的视频到视频配音,但 APIXO 公开的是一个基于肖像和音频的图生视频工作流,没有提供源视频字段。
不可以。APIXO 需要一个上传的音频文件,该录音将驱动最终的视频表现。在调用 InfiniteTalk 之前,请使用单独的录音或文字转语音系统来创建所需的口语或歌唱音频。
上传的音频将驱动人物动态,APIXO 会探测其时长用于计费,最长支持 600 秒。模型没有独立的时长控制参数。在验证最终视频长度时,请考虑处理或编码可能带来的差异。
面部被遮挡、极端姿势、过快语速、音频不清晰、手部靠近面部、画面中有多人以及低质量肖像图都可能增加口型同步错误或视觉漂移的风险。对于长视频输出,应检查其在整个过程中的人物特征和时间连贯性。
探索其他模型
探索更多 AI 模型,赋能您的创意工作流