APIXO
오디오 기반 비디오말하는 아바타오픈 소스

InfiniteTalk은 MeiGen-AI의 오디오 기반 인물 영상 모델로, 입 모양뿐만 아니라 얼굴 표정, 머리 움직임, 신체 자세까지 음성과 동기화합니다. APIXO는 선택적 마스크, 최대 10분의 드라이빙 오디오, 480p 또는 720p 출력, 비동기 전송을 지원하는 인물 사진 및 오디오 중심의 워크플로우를 제공합니다.

APIXO 입력

인물 사진 + 오디오

APIXO 가격

초당 $0.03부터480p, 최소 5초

APIXO 해상도

480p / 720p

오디오 제한

최대 600초

출시일

2025년 8월 19일

InfiniteTalk(으)로 만들기

작업 공간 로딩 중...

입 모양만 맞추는 립싱크를 넘어서

오디오 트랙 하나로 더 완전한 퍼포먼스를 구현하세요

기존의 립싱크 시스템은 종종 입 모양만 수정합니다. InfiniteTalk의 스파스 프레임 접근 방식은 음성과 얼굴 표정, 머리 움직임, 몸 자세를 조화시키면서 시각적 맥락을 사용하여 연속성을 유지합니다. APIXO를 통해 초상화 1개와 업로드된 오디오 트랙 1개로 말하거나 노래하는 완전한 아바타 비디오를 만들 수 있습니다.

기능

오디오로 더 폭넓은 인간의 퍼포먼스를 구현합니다

음성 동기화 모션

InfiniteTalk은 드라이빙 오디오를 사용하여 입 모양과 표정, 머리 움직임, 신체 자세를 조화시킵니다. 입술 동기화가 핵심 목표이지만, 말하는 속도, 자세, 소스 품질에 따라 정확도는 달라질 수 있습니다.

긴 시퀀스 연속성

InfiniteTalk의 업스트림 프레임워크는 생성된 세그먼트 간의 시간적 맥락을 사용하여 더 긴 오디오 기반 시퀀스를 지원합니다. APIXO는 최대 600초의 드라이빙 오디오를 허용하지만, 긴 출력물은 여전히 인물 정체성 변화 및 전환 일관성을 검토해야 합니다.

인물 사진으로 영상 제작

APIXO의 구현은 텍스트로만 된 캐릭터 설명이 아닌, 1개의 초상화 이미지에서 시작됩니다. 소스 이미지는 오디오 기반 움직임이 합성되기 전 피사체의 시각적 정체성, 의상, 구도, 배경을 설정합니다.

음성 및 노래 퍼포먼스

완성된 연설, 대화, 내레이션 또는 노래 오디오로 초상화를 구동하세요. 목소리의 속도, 감정, 발음 및 전달은 이 엔드포인트 내의 텍스트 음성 변환 시스템이 아닌, 제공된 녹음 파일에서 가져옵니다.

긴 오디오 입력

APIXO는 최대 600초 길이의 오디오 파일 1개를 지원합니다. 따라서 일반적인 짧은 아바타 클립보다 긴 자료에도 적합하지만, 길이가 길어질수록 처리 시간과 일관성 요구 사항이 증가합니다.

재현 가능한 반복 작업

480p 또는 720p 출력을 선택하고, 선택적으로 APIXO 시드를 제공할 수 있습니다. 고정된 시드는 통제된 실험을 지원하지만, 입력이 변경되거나 제공업체가 수정될 때 동일한 결과를 보장하지는 않습니다.

API 사양

APIXO를 통한 InfiniteTalk 제어

초상화 및 오디오 전용 워크플로우에 대한 공개 제한입니다.

초상화 1개 + 선택적 마스크

이미지 입력

오디오 URL 1개

오디오 개수

MP3 / WAV / M4A

오디오 형식

128 MB

오디오 크기 제한

5초

최소 과금

비동기 / 콜백

전달

프로덕션 활용 사례

준비된 오디오로 음성 콘텐츠 생성

디지털 발표자

발표자 및 홍보 영상

준비된 인물 사진과 녹음되거나 합성된 음성을 결합하여 발표자 스타일의 콘텐츠를 제작하세요. 이 엔드포인트는 제공된 오디오에 맞춰 애니메이션을 생성하며, 스크립트를 작성하거나 텍스트로 음성을 생성하지는 않습니다.

현지화

현지화된 마케팅 버전

승인된 초상화를 사용하여 지역별 캠페인 버전에 맞게 별도로 제작된 음성 트랙을 재사용하세요. InfiniteTalk은 선언된 언어가 아닌 음향 퍼포먼스에 반응하지만, 모든 녹음에서 발음과 동기화는 검토해야 합니다.

교육

강의 및 트레이닝 모듈

내레이션을 480p 또는 720p의 강사, 가이드, 교육 아바타 영상으로 변환하세요. APIXO의 10분 오디오 제한은 긴 설명을 지원하며, 복잡한 모듈은 더 쉬운 품질 관리를 위해 짧은 세그먼트로 나눌 수 있습니다.

엔터테인먼트

캐릭터 음성 및 노래

대화, 내레이션 또는 노래 오디오를 사용하여 적절한 인물 사진에 애니메이션을 적용하세요. 스타일이 강하거나, 인간이 아니거나, 전신이거나, 여러 인물이 포함된 소스는 APIXO에서 공식적으로 보장하는 기능이 아니므로 프로덕션 포맷으로 확정하기 전에 테스트해야 합니다.

프로덕션 워크플로우

인물 사진, 오디오, 전송 경로 준비

깨끗한 소스 에셋은 피할 수 있는 동기화 및 정체성 문제를 줄여줍니다.

선명한 인물 사진 준비

얼굴이 선명하고 가려짐이 적으며 이미지 품질이 충분한 피사체 1개를 선택하세요. APIXO는 화면 비율이나 카메라 제어 기능을 제공하지 않으므로, 의도한 프레임과 배경을 소스 이미지에 그대로 유지하세요.

완성된 음성 오디오 업로드

128MB 및 600초 제한 내에서 공개적으로 접근 가능한 MP3, WAV, 또는 M4A URL을 하나 제공하세요. 트랙을 제출하기 전에 스크립트 작성, 번역, 음성 생성, 정리, 타이밍 작업을 완료해야 합니다.

모션 생성 및 검토

480p 또는 720p를 선택하고 비동기 작업을 제출한 후, 폴링 또는 콜백을 통해 결과를 가져오세요. 게시하기 전에 입, 치아, 눈, 손, 자세, 인물 일치성 및 세그먼트 전환을 검토하세요.

통합 참고 사항

APIXO가 제공하는 기능 이해하기

중요 제약 사항

01

APIXO는 초상화와 드라이빙 오디오 파일이 필요한 이미지 투 비디오 모드 1가지를 제공합니다.

02

APIXO가 게시한 요청 스키마는 프롬프트를 필수로 표시합니다. 모든 제작 요청 시 명확한 모션 지침을 제출하십시오.

03

비용은 감지된 오디오 길이 또는 5초 중 더 긴 시간을 기준으로 청구됩니다.

04

오디오가 길어질수록 처리 시간이 늘어납니다. 긴 프로덕션 작업에는 콜백 전송 방식이 더 적합합니다.

05

APIXO는 비디오 입력, 화면 비율, 프레임 속도 또는 출력 형식 제어 기능을 공개적으로 제공하지 않습니다.

06

필요한 권리, 동의, 승인을 얻은 경우에만 초상화와 음성을 사용하세요.

InfiniteTalk 관련 질문

이 페이지는 2025년 8월 19일에 기술 보고서, 코드, 모델 가중치와 함께 발표된 MeiGen-AI의 오리지널 InfiniteTalk 연구 버전에 대해 다룹니다. LongCat Video Avatar, 커뮤니티 체크포인트 또는 관련 없는 다른 아바타 시스템에 대해서는 설명하지 않습니다.

공개적으로 문서화된 infinitetalk 스키마를 통해서는 불가능합니다. 업스트림 연구는 오디오 기반의 비디오-투-비디오 더빙을 지원하지만, APIXO는 소스 비디오 필드 없이 초상화와 오디오를 사용한 이미지-투-비디오 워크플로우를 제공합니다.

아니요. APIXO는 업로드된 오디오 파일이 필요하며, 해당 녹음 파일이 결과물의 움직임을 결정합니다. InfiniteTalk을 호출하기 전에 별도의 녹음 또는 텍스트 음성 변환(TTS) 시스템을 사용하여 말하거나 노래하는 오디오를 생성해야 합니다.

업로드된 오디오가 퍼포먼스를 구동하며, APIXO는 과금을 위해 최대 600초까지 오디오 길이를 측정합니다. 별도의 길이 제어 기능은 없습니다. 최종 영상 길이를 확인할 때 처리 또는 인코딩 과정에서 발생할 수 있는 차이를 감안하세요.

가려진 얼굴, 극단적인 자세, 빠른 말투, 불분명한 오디오, 얼굴 근처에 보이는 손, 여러 인물, 저품질 인물 사진 등은 동기화 오류나 시각적 변형을 증가시킬 수 있습니다. 긴 출력물은 전체적으로 인물 정체성 및 시간적 일관성을 검토해야 합니다.

다른 모델 살펴보기

다음 크리에이티브 워크플로우에 필요한 더 많은 AI 모델을 만나보세요