ElevenLabs, v4 음성 모델 출시 — 90개 언어, 10초 클로닝, 표정 태그 지원

ElevenLabs, v4 음성 모델 출시 — 90개 언어, 10초 클로닝, 표정 태그 지원

ElevenLabs가 90개 언어를 지원하고 10초 음성 샘플로 클로닝이 가능한 Eleven v4 모델을 공개했어요.

ElevenLabs가 9월 28일 새 음성 합성 모델 Eleven v4와 v4 Turbo를 공개했어요. 이번 업데이트에서 가장 눈에 띄는 변화는 지원 언어의 확장인데, 기존 70개에서 90개로 늘었고 일본어·브라질 포르투갈어·광둥어·북경어 등의 품질이 눈에 띄게 향상됐어요. 목소리 클로닝에 필요한 음성 샘플도 단 10초로 줄어들어 더욱 접근하기 쉬워졌고, 긴 텍스트에서도 목소리 정체성을 일관되게 유지하는 능력이 강화됐어요. 기존 버전에서 도입된 인라인 표정 태그(예: [laughs], [whispers])는 이번 버전에서 여러 태그를 순차적으로 적용할 수 있도록 확장돼 더욱 자연스러운 감정 표현이 가능해졌어요.

음성 에이전트 분야에서도 중요한 개선이 이루어졌어요. v4는 레이턴시가 더 낮아지고 대규모 언어 모델의 응답에 맞춰 실시간으로 오디오를 생성하는 능력이 향상됐어요. 고객 응대 시나리오에서 대립·에스컬레이션·대기 상황을 더 자연스럽게 처리할 수 있게 돼 게임 NPC 대화, 영상 더빙, 인터랙티브 스토리텔링 등 다양한 크리에이티브 분야에서의 실시간 활용이 한층 현실적으로 됐어요. 최근 ElevenLabs는 220억 달러 기업 가치로 평가받는 등 AI 음성 분야의 선도 주자로서 입지를 확고히 하고 있어요.

원문: TechCrunch