Meta, 실시간 음성 인식 모델 'Muse Voice Transcribe' 공개
화자 분리·발화 종점 감지를 단일 모델로 처리. 70여 개 언어·후처리 없는 장시간 세션 지원해 음성 앱 스택 단순화 가능.
요약
Scale AI의 CEO Alexandr Wang은 실시간 음성 인식 모델인 Muse Voice Transcribe를 새롭게 공개했다. 이 모델은 스트리밍 음성-텍스트 변환(Speech-to-Text) 분야에서 SOTA 수준의 성능을 제공하며, 화자 분리(speaker diarization) 및 종결점 검출(endpointing) 기능을 단일 모델 내에서 네이티브로 처리한다. Muse Voice Transcribe는 적응형 지연(adaptive delay) 기술을 활용해 필요한 문맥의 양을 스스로 판단하며, 70개 이상의 언어로 학습되었고 출시 시점에 25개 언어에 대한 검증을 완료했다. 또한 문장 중간의 언어 혼용(code-switching)을 지원하며, 1시간 이상의 긴 세션과 20명 이상의 다중 화자 상황에서도 별도의 후처리 없이 정확한 인식이 가능하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @alexandr_wang: 1/ today we're rolling out muse voice transcribe, our first real-time audio perception model - SOTA in streaming speech-to-text. a
원문 보기 ↗