MoZoo: 영상 디퓨전으로 동물 캐릭터의 털·근육 시뮬레이션을 자동화
거친 3D 메시만으로 사실적인 동물 털·근육 움직임을 자동 생성하는 AI 모델 MoZoo가 공개됐어요.
Orange Team 연구팀이 거친 3D 메시만으로 사실적인 동물 털과 근육 움직임을 자동 생성하는 AI 모델 MoZoo를 공개했어요. 새롭게 설계한 Role-Aware RoPE(RAR-RoPE) 어텐션 메커니즘은 동작 정렬과 레퍼런스 정보를 효과적으로 분리해 동기화 문제를 해결하고, Asymmetric Decoupled Attention으로 계산 효율도 크게 높였어요. 텍스트·이미지 등 멀티모달 가이던스를 함께 활용하며, 렌더링 엔진과 역매핑 기법으로 대규모 합성-실사 쌍 데이터셋 MoZoo-Data와 120쌍의 메시-영상 벤치마크 MoZooBench도 함께 공개됐어요.
기존 CG 파이프라인에서 동물 털과 근육 시뮬레이션은 전문 아티스트가 수십 시간을 투입해야 하는 고난이도 작업이에요. MoZoo는 영상 디퓨전 모델의 생성 능력을 활용해 이 과정을 자동화함으로써, 번거로운 수작업 정제 없이도 고품질 동물 영상을 제작할 수 있게 해줘요. 다양한 동물 골격과 레이아웃에서 뛰어난 시간적·구조적 일관성을 유지하며, 대형 스튜디오뿐 아니라 소규모 팀도 영화급 동물 표현을 구현할 수 있는 길을 열어줬어요.
이 기술은 게임·영화 캐릭터 아트 제작 파이프라인을 혁신할 것으로 기대돼요. 코드와 데이터셋이 오픈소스로 공개돼 있어, 인디 개발사나 소규모 VFX 스튜디오도 즉시 활용할 수 있다는 점이 특히 주목할 만해요. 게임 동물 캐릭터의 제작 시간과 비용을 획기적으로 줄여줄 기술로, 앞으로의 활용 사례가 기대돼요.