참고X
알리바바, Qwen-Audio-3.0-TTS 공개…실시간 상호작용 및 정밀 제어 지원
태그 기반의 정교한 발화 제어와 긴 문장 생성을 지원하는 신규 음성 합성 모델 공개.
요약
알리바바가 새로운 텍스트-투-스피치(TTS) 모델인 'Qwen-Audio-3.0-TTS'를 공개했다. 실시간 상호작용에 최적화된 'Flash' 버전과 고품질 생성에 특화된 'Plus' 버전으로 나뉘며, 현재 Artificial Analysis TTS 리더보드에서 1위를 기록 중이다. 주요 특징으로는 [whisper], [angry] 등 미세 조정 인라인 태그와 자연어 프롬프트를 통한 제어가 가능하며, 16개 언어를 지원한다. 특히 노이즈가 섞인 참조 오디오에서도 깨끗한 출력이 가능하며, 한 번에 최대 3분 길이의 긴 오디오 생성도 지원한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Alibaba_Qwen: Introducing the Qwen-Audio-3.0-TTS. Our latest text-to-speech model, in two flavors: • Flash: real-time interaction • Plus: high-q
원문 보기 ↗