StepFun, 음성 인식 모델 'StepAudio 3 ASR' 공개 — 비스트리밍 1위·오류율 1.7%
중국 AI 스타트업 StepFun이 단어 오류율 1.7%로 비스트리밍 음성-텍스트 변환 1위를 차지했어요.
중국 AI 스타트업 StepFun이 9월 22일 음성 인식 모델 StepAudio 3 ASR을 발표했어요. AA-WER 인덱스 비스트리밍 음성-텍스트 변환 부문에서 단어 오류율(WER) 1.7%로 59개 모델 평가 1위를 기록했어요. 이는 전 세대 모델인 StepAudio 2.5 ASR의 4.7%에서 크게 개선된 수치로, 단 한 번의 업데이트로 오류율이 60% 이상 줄어든 거예요. 비스트리밍 방식은 오디오 파일을 실시간이 아닌 전체 처리 방식으로 변환하는 것으로, 기업 받아쓰기 파이프라인, 법률·의료 문서화, 미디어 자막 작업에 널리 쓰여요.
이번 업데이트로 영어 오류율은 25%, 방언은 22.3%, 의료·금융·법률 등 전문 분야는 42.1% 개선됐으며, 속삭임이나 음악 위 노래까지 인식하는 내구성도 갖췄어요. StepAudio 3는 ASR 외에도 실시간 대화(Realtime), 음성 합성(TTS), 음향·음악 생성(Gen·Music) 모델을 함께 출시해 완전한 오디오 스택을 구성했어요. 이 성과는 음성 인식 분야에서 기존 미국 업체들의 가격 경쟁력을 압박하는 신호로 읽히며, 콘텐츠 제작자와 미디어 기업에게도 주목받는 대목이에요.
원문: 247 Wall St.