Diff-VF: 기존 단편 영상 디퓨전 모델을 추가 학습 없이 장편 생성 모델로 전환

Diff-VF: 기존 단편 영상 디퓨전 모델을 추가 학습 없이 장편 생성 모델로 전환

Diff-VF가 기존 단편 영상 생성 모델을 재학습 없이 장편 생성에 쓸 수 있도록 변환해요.

Diff-VF는 학습·플러그인·모델 변경 없이 기존 단편 영상 생성 디퓨전 모델을 장편 영상 생성에 활용할 수 있도록 전환하는 프레임워크예요. 2026년 8월 6일 arXiv에 공개된 이 연구는 대부분의 비디오 디퓨전 모델이 단편 영상으로 학습되어 장편으로 확장하면 시간적 일관성이 무너지는 문제를 해결해요. Hybrid Noise Initialization(HNI)으로 전역 의미를 제약하고, Weighted Window Sampling(WWS)으로 윈도우 간 불연속을 제거하며, Temporal Extended Sampling(TES)으로 장거리 의존성을 확립하는 세 가지 전략을 결합했어요.

ACM TOMM에 게재 확정된 이 연구는 VBench-Long 평가에서 시간적 일관성과 모션 다양성 간 균형에서 FreeNoise, FreeLong, RIFLEx 등 기존 학습-불필요 방법들을 앞섰어요. 이미 보유한 단편 영상 생성 모델로 긴 시네마틱·애니메이션 시퀀스를 만들 수 있어, 재학습 비용 없이 기존 파이프라인을 장편 생성으로 확장하려는 스튜디오에 즉시 도움이 될 기술이에요.

원문: arXiv (cs.CV)