EffectLearner: VLM이 물체-이펙트 관계를 추론해 영상에서 이펙트를 정밀 제거
EffectLearner가 VLM으로 물체-이펙트 관계를 추론해 영상 속 시각 이펙트를 정밀하게 제거해요.
EffectLearner는 VLM 기반 Object-Effect Reasoner와 DiT 기반 Video Eraser를 결합해 영상 속 시각 이펙트를 의미론적 추론으로 제거하는 프레임워크예요. 2026년 8월 6일 arXiv에 공개된 이 연구는 기존 영상 오브젝트 제거 방식이 사전 정의된 이펙트 카테고리와 고정 데이터 분포에서 암묵적으로 대응 관계를 학습하기 때문에 복합 이펙트, 공간적으로 분리된 이펙트, 롱테일 물리 현상 등 실제 환경에 대한 일반화가 부족하다는 점을 지적해요. Reasoner가 구조화된 이펙트 분석 프롬프트로 크로스모달 추론을 수행하고, 그 결과를 Video Eraser에 전달해 포괄적인 오브젝트-이펙트 제거를 유도해요.
모션 인식 마스크 가이던스와 모션 일관성 감독으로 오브젝트 움직임에서도 시공간 안정성을 확보했으며, 복잡한 오브젝트 유발 이펙트에 특화된 EffectWorld 데이터셋도 함께 공개했어요. 게임 영상 편집, 실사 참고 영상에서의 특수효과 제거, CGI 포스트 프로덕션 등 영상 기반 게임 개발·마케팅 파이프라인에 실용적인 도구가 될 것으로 기대돼요.
원문: arXiv (cs.CV)