참고AI타임스
알리바바, 실시간 TTS 모델 'Qwen-Audio-3.0-TTS' 공개
실시간 응답과 고음질을 강조한 두 가지 버전 출시. 음성 기반 에이전트 개발 시 대안으로 검토할 가치가 있음.
요약
알리바바가 실시간 대화형 AI 및 콘텐츠 제작 시장을 겨냥한 차세대 텍스트 음성 변환(TTS) 모델 '큐원-오디오-3.0-TTS(Qwen-Audio-3.0-TTS)'를 20일 공개했다. 이번 신규 모델은 실시간 응답에 최적화된 '플래시(Flash)'와 음질 중심의 '플러스(Plus)' 두 가지 버전으로 구성된다. 특히 플러스 모델은 아티피셜 애널리시스 TTS 리더보드에서 1위를 기록하며 뛰어난 성능을 입증했다. 해당 모델은 16개 언어를 지원하며, 오픈 웨이트 형태로 배포되어 실무자가 직접 다운로드하여 활용할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 알리바바, 16개 언어 지원 ‘큐원-오디오-3.0-TTS’ 공개… "스피치 아레나 1위"
원문 보기 ↗