참고팁X
로컬 음성 에이전트 개발용 오픈소스 모델 'Hojo-ASR-Multi-V1' 공개
클라우드 API 의존도와 지연 시간 문제를 해결할 수 있는 오픈소스 ASR 모델로 로컬 배포 가능.
요약
로컬 음성 에이전트 구축 시 클라우드 API 사용으로 인한 비용 부담과 지연 시간 문제가 개발자들의 주된 걸림돌로 지적되어 왔다. 기존 오픈 모델들은 로컬 환경에서 구동할 경우 악센트나 대화형 음성 인식 정확도가 낮다는 한계가 있었다. 이를 해결하기 위해 Hojo는 오픈 소스 모델인 Hojo-ASR-Multi-V1을 공개했다. 해당 모델은 다국어 Open ASR 리더보드 기준 독일어, 프랑스어 등 13개 벤치마크 데이터셋에서 평균 3.54의 WER(단어 오류율)을 기록했다. 이는 클라우드 기반의 독점적인 음성 인식 서비스들과 대등한 수준의 성능이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ai_for_success: For me, the main reason building local voice agents is painful has always been speech-to-text. Sending every audio stream to cloud
원문 보기 ↗