Vidu S1: 음성 명령으로 디지털 캐릭터를 실시간 조종하는 영상 생성 모델
칭화대 연구팀이 음성 지시로 캐릭터를 실시간 조작하고 무한 길이 영상을 생성할 수 있는 'Vidu S1' 모델을 공개했어요.
칭화대 연구팀이 음성 지시로 디지털 캐릭터를 실시간 조작할 수 있는 영상 생성 모델 'Vidu S1'을 공개했어요. TurboDiffusion과 TurboServe 기술 덕분에 일반 소비자용 GPU에서 540p 영상을 최대 42 FPS로 생성할 수 있고, 실제 인물·애니메이션·반려동물 사진을 업로드해 커스텀 캐릭터를 만들 수 있어요. 음성 명령으로 캐릭터의 동작을 제어하면서 끊김 없는 무한 길이 영상을 실시간으로 생성하는 점이 가장 큰 특징이에요.
Vidu S1은 모든 테스트 지표에서 최고 성능을 달성했으며, 실시간 추론 요건도 충족했다고 연구팀이 밝혔어요. 영상 생성 과정에서 화질 저하 없이 무한 연장이 가능하고, 음성 톤 선택 기능까지 갖춰 표현의 다양성을 높였어요. 게임 내 인터랙티브 컷씬, NPC 캐릭터 프리뷰 영상 제작, 나아가 라이브 스트리밍 환경에서의 실시간 캐릭터 퍼포먼스 등 다양한 활용처가 기대돼요. 깃허브와 데모 플랫폼을 통해 직접 체험해볼 수 있어요.