← promppy_ 실시간 AI 뉴스
참고X

오픈소스 음성 인식 모델 'Hojo-ASR-Multi-V1' 공개

대화형 오디오 처리에 최적화된 모델로, 기존 상용 API 대비 성능이 뛰어나 로컬/오픈소스 구축 시 고려할 만함.

요약

기존 음성 인식 벤치마크와 실제 환경 간의 가장 큰 간극은 대화형 음성 처리 능력에 있다. 대다수 모델은 깨끗한 음성 데이터에서는 우수한 성능을 보이나, 말더듬이나 배경 소음, 문장 중간의 수정 등이 포함된 실생활 대화에서는 성능이 급격히 저하된다. 최근 Hojo는 이러한 문제를 개선한 Hojo-ASR-Multi-V1을 Apache 2.0 라이선스로 오픈소스로 공개했다. 해당 모델은 최신 Open ASR 리더보드에서 독일어, 프랑스어, 이탈리아어, 스페인어, 포르투갈어 평균 3.54 WER(Word Error Rate)을 기록했다. 이는 Azure나 AssemblyAI 같은 폐쇄형 API와 대등한 수준이면서도 실제 대화형 오디오 처리 능력은 더욱 뛰어나다는 평가를 받는다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @ai_for_success: I think the biggest gap between speech benchmarks and real-world usage is conversational speech. Most models do fine on clean audi

원문 보기 ↗

광고

다음 뉴스 →

중요'데빈' 개발사 코그니션, 기업가치 64조원 달성…4개월 만에 85% 급등

AI 코딩 에이전트에 자본 집중 가속. Cursor·Claude Code 등과의 경쟁 지형 변화 주시.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스