중요AI타임스
메타, 실시간 음성 인식 모델 '뮤즈 보이스 트랜스크라이브' 공개…단어 오류율 3.1%로 1위
화자 분리·발화 종료 감지까지 단일 모델 처리. 실시간 음성 서비스 저지연 대안으로 검토 가치.
요약
메타가 실시간 음성 인식, 화자 분리, 발화 종료 감지를 통합한 새로운 음성 AI 모델 '뮤즈 보이스 트랜스크라이브(Muse Voice Transcribe)'를 1일(현지시간) 공개했다. 메타 슈퍼인텔리전스 랩스(MSL)가 개발한 이 모델은 단어 오류율 3.1%를 달성하며 스트리밍 음성 인식 벤치마크 1위에 올랐다. 특히 80밀리초(ms) 단위로 정확도와 처리 속도를 자율적으로 조절하는 기술을 갖춰 실시간 스트리밍 자동음성인식(ASR) 분야에서 높은 성능을 확보했다. 메타가 실시간 오디오 인식 모델을 독자적으로 출시한 것은 이번이 처음이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 메타, 실시간 음성 '뮤즈 보이스 트랜스크라이브' 공개...단어 오류율 1위
원문 보기 ↗