오픈소스 음성 인식 모델 'Hojo-ASR-Multi-V1' 공개
대화형 오디오 처리에 최적화된 모델로, 기존 상용 API 대비 성능이 뛰어나 로컬/오픈소스 구축 시 고려할 만함.
요약
기존 음성 인식 벤치마크와 실제 환경 간의 가장 큰 간극은 대화형 음성 처리 능력에 있다. 대다수 모델은 깨끗한 음성 데이터에서는 우수한 성능을 보이나, 말더듬이나 배경 소음, 문장 중간의 수정 등이 포함된 실생활 대화에서는 성능이 급격히 저하된다. 최근 Hojo는 이러한 문제를 개선한 Hojo-ASR-Multi-V1을 Apache 2.0 라이선스로 오픈소스로 공개했다. 해당 모델은 최신 Open ASR 리더보드에서 독일어, 프랑스어, 이탈리아어, 스페인어, 포르투갈어 평균 3.54 WER(Word Error Rate)을 기록했다. 이는 Azure나 AssemblyAI 같은 폐쇄형 API와 대등한 수준이면서도 실제 대화형 오디오 처리 능력은 더욱 뛰어나다는 평가를 받는다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ai_for_success: I think the biggest gap between speech benchmarks and real-world usage is conversational speech. Most models do fine on clean audi
원문 보기 ↗