PhyGenHOI: 물리 시뮬레이션과 모션 디퓨전을 결합한 4D 인간-오브젝트 상호작용 생성
텍스트 입력만으로 물리적으로 정확한 4D 인간-오브젝트 상호작용 장면을 생성하는 PhyGenHOI가 공개됐어요.
히브리 대학교 연구팀이 텍스트 입력만으로 인간이 오브젝트를 차거나 치는 등 물리적으로 정확한 4D 상호작용 장면을 생성하는 PhyGenHOI 프레임워크를 발표했어요. 인간은 모션 디퓨전 모델(MDM)로 구동되는 시맨틱 에이전트로, 오브젝트는 물질점법(MPM) 물리 시뮬레이터로 제어되는 물리 에이전트로 모델링하며, 3D 가우시안 스플랫(3DGS)을 통합된 미분 가능 표현으로 사용해요.
세 가지 결합 메커니즘이 PhyGenHOI의 핵심이에요. Windowed Attraction Loss는 생성 모션이 오브젝트를 시간적으로 정확히 가로채도록 동기화하고, Contact-Driven Re-simulation 단계는 충격 시 물리적으로 일관된 운동량 전달을 트리거해요. Masked Video-SDS 목적함수는 영상 기반 사전 지식을 주입해 접촉 정확도를 높여요. 다양한 동작·인간·오브젝트 조합에서 기존 기준 모델을 앞서는 성능이 실험으로 확인됐어요.
이 기술은 게임 컷신·애니메이션 제작에서 모션 캡처 없이도 물리 기반 인터랙션 장면을 자동으로 생성할 수 있게 해줘요. 텍스트 한 줄로 펀치·킥 등 다양한 액션 연출이 가능해져, 프리프로덕션 단계의 비용과 시간을 크게 줄여줄 것으로 기대돼요.