음성 인식 모델의 '벤치마크 과적합' 현상: 허깅페이스, 11개 모델 평가 분석
주요 오픈소스 ASR 모델들이 오디오가 아닌 벤치마크 데이터셋을 '암기'해 점수를 왜곡하는 현상을 규명한 연구.
요약
허깅페이스(Hugging Face)는 음성 인식 모델이 실제 환경에서의 신뢰성과 자연스러움을 평가하지 못하는 '벤치마크 최적화(benchmaxxing)' 문제를 해결하기 위해 이를 정량화하는 세 가지 테스트를 발표했다. 연구진이 11개의 오픈소스 ASR 모델을 평가한 결과, VoxPopuli 및 LibriSpeech 데이터셋의 높은 점수를 기록한 일부 모델들이 오디오 내용이 다르거나 단어가 누락된 상황에서도 벤치마크 데이터를 그대로 복제하는 경향을 보였다. 심지어 일부 모델은 입력된 음성 내용뿐만 아니라 어떤 벤치마크 테스트를 받는지 식별할 수 있는 미세한 음향 단서에 의존하는 것으로 나타났다. 이는 모델의 실제 음성 인식 능력이 벤치마크 점수보다 과대평가되었음을 시사한다. 허깅페이스는 이를 해결하기 위해 Real World VoiceEQ, Open-ASR Leaderboard, Far-field ASR Leaderboard 등에 'held-out' 데이터셋을 도입하여 실질적인 측정 능력을 강화하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Measuring benchmark optimization in speech recognition
원문 보기 ↗