Krisp, STT 음성 분리 벤치마크 데이터셋 오픈소스 공개
배경 소음 제거 성능을 평가할 수 있는 실측 기반 벤치마크 데이터셋 활용 가능.
요약
Krisp는 STT(Speech-to-Text) 성능을 저해하는 주변 소음 문제를 해결하기 위해 'Krisp Voice Isolation' 벤치마크 데이터를 허깅페이스(HuggingFace)에 오픈소스로 공개했다. 실제 녹음본 265개를 활용한 이번 테스트에서 음성 분리 기술 적용 시 STT의 단어 오류율(WER)이 23.3%에서 6.2%로 약 73% 감소하는 효과를 확인했다. 특히 공유 오피스나 콜센터 환경에서 성능 개선 폭이 컸으며, 이는 합성 데이터가 아닌 실제 환경의 녹음본을 기반으로 재현 가능하다. Krisp Voice Isolation은 현재 200개 이상의 음성 플랫폼에 적용되어 100억 분 이상의 음성 에이전트 오디오를 처리해 왔다. 이번 데이터 공개를 통해 개발자들은 음성 분리 기술이 STT 정확도 향상에 미치는 영향을 구체적으로 검증할 수 있게 되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @DataChaz: STT MOSTLY BEAT BACKGROUND NOISE But it still loses when another person starts talking nearby. @krispHQ just open-sourced its 'Kri
원문 보기 ↗