중요X
알리바바, TTS 모델 Qwen-Audio-3.0-TTS 공개…실시간·고품질 두 버전
16개 언어·자연어 스타일 제어·불완전 음원 보이스 클로닝 지원. 음성 서비스 후보로 검토 가치.
요약
알리바바 통이랩(Ali_TongyiLab)이 최신 텍스트 음성 변환(TTS) 모델인 Qwen-Audio-3.0-TTS를 공개했다. 이번 모델은 실시간 상호작용에 최적화된 Flash 버전과 고품질 생성을 지원하는 Plus 버전 등 두 가지 형태로 출시되었다. 16개 언어를 지원하며 자연어를 통한 스타일 제어 기능을 제공한다. 비언어적 세부 사항을 조절할 수 있는 정밀 태그 기능이 추가되었고, 불완전한 오디오 데이터를 활용한 음성 복제 성능도 크게 향상되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Ali_TongyiLab: Qwen-Audio-3.0-TTS is here. 🎙️ Our latest text-to-speech model, in two flavors: • Flash: real-time interaction • Plus: high-quali
원문 보기 ↗