EmoWorld: 감정과 장면 맥락을 분리해 더 세밀한 감정 표현 영상 생성

EmoWorld: 감정과 장면 맥락을 분리해 더 세밀한 감정 표현 영상 생성

EmoWorld가 감정 분위기·의미·시간 변화를 분리해 27가지 감정 카테고리 영상을 세밀하게 제어해요.

EmoWorld는 감정 표현과 장면 배경 요소를 분리(decouple)해 각각 독립적으로 제어하면서 감정 주도 영상을 생성하는 프레임워크예요. 2026년 8월 6일 arXiv에 공개된 이 연구는 기존 영상 생성기가 전역 분위기, 감정 의미 신호, 시간적 진행을 하나의 텍스트 조건으로 혼용해 세밀한 감정 제어가 어렵다는 문제를 해결해요. Frozen 플로우 매칭 Video DiT 위에서 Visual Atmosphere Steering(VAS), Semantic Affective Steering(SAS), Temporal Affective Steering(TAS) 세 가지 스티어링 방식을 독립적으로 적용하는 구조예요.

Wan2.2 기반 실험에서 VAS는 목표 감정 정렬을 19% 향상시키면서 시간적 변동을 48% 줄였고, SAS는 감정 정렬을 37% 개선하고 감정 신호 감지를 36% 늘렸어요. 27개 감정 카테고리에서 텍스트-투-비디오와 이미지-투-비디오 모두 검증됐으며, 여러 Video-DiT 백본에 이식 가능해 애니메이션 캐릭터·디지털 인플루언서의 감정 연출이나 게임 컷씬 제작 파이프라인에 바로 활용할 수 있어요.

원문: arXiv (cs.CV)