Viggle-Animate: Character Replacement in Video from a Single Repainted Frame

Viggle-Animate: Character Replacement in Video from a Single Repainted Frame

단 한 장의 리페인트 프레임으로 영상 속 캐릭터를 교체하는 오픈소스 비디오 모델 Viggle-Animate가 공개됐어요.

Viggle-Animate는 영상의 캐릭터를 단 한 장의 리페인트 프레임만으로 교체할 수 있는 오픈소스 비디오 모델이에요. 사용자가 영상에서 프레임을 하나 골라 이미지 편집기로 캐릭터 외형을 바꾸면, 모델이 그 변경 사항을 나머지 전체 영상에 걸쳐 자동으로 전파해요. 비디오 추론 단계에서는 포즈 추정기·세그멘테이션·얼굴 추적기·텍스트 프롬프트가 전혀 필요 없고, 단 세 번의 순전파로 B200 GPU 한 장에서 124프레임을 26초 안에 생성할 수 있어요.

모델은 MiniMax-H3의 33.1B 파라미터 ref2va 트랜스포머를 기반으로, DMD(분포 매칭 증류) 기법을 통해 추론 횟수를 원래 30회에서 3회로 줄였어요. 같은 하드웨어와 해상도 조건에서 Wan2.2-Animate-14B보다 6.1배 빠른 렌더링 속도를 보여요. 리페인트 프레임이 원본 영상에서 직접 추출되기 때문에 포즈·조명·배경이 이미 정렬된 상태라서, 기존 방식처럼 외부 참조 이미지와 영상 간 불일치 문제가 없어요. 인간 캐릭터뿐 아니라 동물, 스타일화 캐릭터, 일부 비인간형 오브젝트도 지원해요.

고소음 레벨에서는 파인튜닝된 모델로, 저소음 레벨에서는 원본 MiniMax-H3 모델로 증류하는 듀얼-티처 방식을 채택해 교체 충실도와 시각 품질 두 마리 토끼를 모두 잡았어요. 모델 가중치와 추론 코드는 Apache 2.0 라이선스로 공개됐으며, HuggingFace에서 즉시 체험해볼 수 있는 데모 스페이스도 제공돼요.

원문: viggle.ai