참고X
Qwen, 도메인 특화 음성 인식 모델 'Qwen-Audio-3.0-ASR-Flash' 공개
의료 및 산업 도메인 용어 인식 성능이 향상된 ASR 모델. 관련 분야 음성 데이터 파이프라인 개발 시 검토 필요.
요약
알리바바 그룹이 새로운 음성 인식 모델인 Qwen-Audio-3.0-ASR-Flash를 공개했다. 이번 모델은 맥락 이해력과 도메인 용어 인식 능력을 대폭 강화한 것이 특징이며, 사용자 정의 핫워드 기능과 음성을 구조화된 텍스트로 변환하는 기능을 지원한다. 내부 테스트 결과, 의료 용어 재현율 95.36%, 산업 용어 재현율 93.24%를 기록하며 높은 정확도를 입증했다. 스트리밍 처리와 파일 변환 등 다양한 환경에서 활용할 수 있는 세 가지 버전으로 출시되었다. 관심 있는 사용자는 제공된 링크를 통해 모델의 상세 내용을 확인하고 이용할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Alibaba_Qwen: Introducing Qwen-Audio-3.0-ASR-Flash: More context-aware. Stronger domain-term recognition. 🚀Our latest ASR model upgrades: • Con
원문 보기 ↗