minWM: 영상 디퓨전 모델을 실시간 인터랙티브 월드 모델로 변환하는 오픈소스 프레임워크
기존 영상 생성 모델을 카메라 제어 가능한 실시간 인터랙티브 월드 모델로 변환하는 오픈소스 파이프라인 minWM이 공개됐어요.
ShengShu·청화대(THU) 공동 연구팀이 기존 양방향 영상 디퓨전 모델(Wan2.1, HunyuanVideo)을 카메라 제어가 가능한 실시간 인터랙티브 월드 모델로 변환하는 전체 파이프라인 minWM을 오픈소스로 공개했어요. 데이터 구축, 카메라 제어 파인튜닝, 자기회귀(AR) 디퓨전 학습, 소수-스텝 증류, 저지연 추론까지 전 과정을 하나의 모듈식 파이프라인으로 통합했어요.
핵심 기술은 Causal Forcing / Causal Forcing++ 증류 기법이에요. 다단계 양방향 디퓨전 모델을 소수-스텝 자기회귀 생성 모델로 전환해 첫 프레임 레이턴시를 최대 224~236배 단축했어요. HY1.5 기반 모델은 771초에서 3.4초로, Wan2.1 기반 모델은 269초에서 1.1초로 줄었으며, 카메라 제어 능력도 증류 과정에서 온전히 유지돼요.
게임 엔진의 카메라 제어 영상 프리뷰나 버추얼 프로덕션 사전 시각화에 바로 활용할 수 있어요. 코드·체크포인트·문서가 모두 오픈소스로 공개돼 있어, 소규모 팀도 자체 월드 모델을 직접 빌드하거나 새 데이터와 레이턴시 목표에 맞게 기존 모델을 파인튜닝할 수 있어요.