알리바바, Qwen-Audio-3.1 공개…음성 스택 전면 개편에 API 가격 최대 95% 인하
ASR·TTS·Realtime 대폭 인하로 음성 서비스 비용 재계산 가치. 다화자·감정 인식 기능도 신규 추가.
요약
Alibaba Qwen은 음성 인식, 합성, 실시간 대화를 통합한 오디오 모델 라인업인 Qwen-Audio-3.1을 공개했다. 이번 업데이트는 다국어 및 방언 인식 능력을 강화한 ASR과 감정 표현이 가능한 TTS를 포함하며, 신규 모델인 TTS-Next(음성 생성)와 ASR-Next(음성 이해)가 추가되었다. 특히 ASR-Next는 다중 화자 식별, 타임스탬프, 감정 및 환경음 분석 기능을 제공하며, Realtime 모델은 실시간 끼어들기 및 공감형 응대가 가능하다. 또한 TTS 약 70%, Realtime 약 85%, ASR 최대 95% 등 대규모 가격 인하를 단행했다. Qwen-Audio-3.1은 통합 오디오 스택을 통해 오디오북, 게임, 광고 등 다양한 분야에서 활용할 수 있는 포괄적인 음성 솔루션을 지원한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Alibaba_Qwen: ⚡ Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next
원문 보기 ↗