Stability AI, 6분 길이 노래 생성 가능한 새 오디오 모델 출시

Stability AI, 6분 길이 노래 생성 가능한 새 오디오 모델 출시

Stability AI가 최대 6분 20초 분량의 음악을 생성하는 'Stable Audio 3.0' 패밀리를 공개하며, 오픈 웨이트 모델도 포함됐어요.

Stable Diffusion으로 잘 알려진 AI 스타트업 Stability AI가 최대 6분 20초 길이의 음악을 생성할 수 있는 새 오디오 모델 패밀리 'Stable Audio 3.0'을 출시했어요. 소형 SFX(459M 파라미터), 소형(459M), 중형(1.4B), 대형(2.7B) 총 4가지 모델로 구성되며, 소형 두 종류는 기기 내 음향 및 음악 생성에 최적화되어 최대 2분 분량을 만들 수 있어요. 중형과 대형 모델은 음악적 구조와 멜로딕 톤을 일관되게 유지하며 6분 20초짜리 완성도 높은 풀 컴포지션을 생성할 수 있으며, 이는 2024년 Stable Audio 2.0 대비 두 배 이상의 생성 시간이에요.

소형 SFX, 소형, 중형 모델은 오픈 웨이트로 누구나 자유롭게 사용하고 수정할 수 있어요. 이전에 공개된 Stable Audio Open이 최대 47초의 음악만 생성할 수 있었던 점과 비교하면 획기적인 발전이에요. 반면 대형 모델은 API와 유료 셀프 호스팅 서비스를 통해서만 제공되며, 연 매출 100만 달러 이상 기업은 별도의 엔터프라이즈 라이선스가 필요해요. Stability AI는 지난해 Warner Music Group과 Universal Music Group과의 파트너십을 맺어 이번 모델이 완전히 라이선스된 데이터로 학습됐다고 강조했어요.

AI 음악 생성 시장에서는 구글 Lyria 3 Pro, ElevenLabs 등 경쟁 제품들이 연이어 출시되며 경쟁이 치열해지고 있어요. Stability AI는 음악 산업 베테랑 Ethan Kaplan(전 Universal Audio·Fender CDO)을 영입해 전문 뮤지션용 제품 개발을 이끌게 했어요. 게임 아트 제작 측면에서는 텍스트 프롬프트 하나로 완성도 있는 6분짜리 배경음악을 바로 생성할 수 있게 됐다는 점이 매우 실용적이에요. 인디 게임 팀도 전문 사운드트랙 수준의 음악을 저비용으로 확보할 수 있어, 게임 제작 파이프라인에서 사운드 제작의 접근성이 크게 높아질 것으로 기대돼요.

원문: TechCrunch