NAVA: Baidu의 오디오-비주얼 네이티브 정렬 기반 동영상·오디오 동시 생성 모델
텍스트 한 줄로 영상과 오디오를 시간적으로 동기화해 함께 생성하는 Baidu의 NAVA 모델이 공개됐어요.
Baidu ERNIE 팀이 텍스트 한 줄로 영상과 오디오를 시간적으로 정확히 동기화해 함께 생성하는 NAVA(Native Audio-Visual Alignment) 모델을 공개했어요. NAVA는 먼저 오디오와 영상 간의 상응 관계를 전용 인터랙션 공간에서 확립한 뒤, 외부 컨텍스트로 공동 노이즈 제거 과정을 조건화하는 Align-then-Fuse MMDiT 아키텍처를 채택했어요. Timbre-in-Context 조건부 컨트롤로 참조 음색을 특정 발화 구간에 연결하는 제어 가능한 음성 음색도 구현했어요.
기존의 듀얼타워 방식(사후 정렬)이나 텍스트-오디오-비디오 삼중 혼합 방식은 미세한 오디오-영상 공진화를 약화시키거나 시맨틱 조건화와 저수준 동기화를 혼용하는 문제가 있었어요. NAVA는 이 두 한계를 모두 해결하면서 6.3B 파라미터로 Verse-Bench·Seed-TTS 벤치마크에서 영상 품질, 정밀한 오디오-비주얼 동기화, 참조 음색 제어력 모두에서 우수한 성과를 달성했어요.
이 기술은 게임 트레일러·애니메이션 예고편 등 창작 영상 제작에서 영상과 사운드를 하나의 파이프라인으로 동시에 만들 수 있게 해줘요. 별도의 오디오 후처리 없이도 정확히 싱크가 맞는 결과물을 얻을 수 있어, 창작 콘텐츠 제작의 효율이 크게 높아질 것으로 기대돼요.