← promppy_ 실시간 AI 뉴스
참고X

알리바바, Qwen-Audio-3.0-TTS 공개…실시간 상호작용 및 정밀 제어 지원

태그 기반의 정교한 발화 제어와 긴 문장 생성을 지원하는 신규 음성 합성 모델 공개.

요약

알리바바가 새로운 텍스트-투-스피치(TTS) 모델인 'Qwen-Audio-3.0-TTS'를 공개했다. 실시간 상호작용에 최적화된 'Flash' 버전과 고품질 생성에 특화된 'Plus' 버전으로 나뉘며, 현재 Artificial Analysis TTS 리더보드에서 1위를 기록 중이다. 주요 특징으로는 [whisper], [angry] 등 미세 조정 인라인 태그와 자연어 프롬프트를 통한 제어가 가능하며, 16개 언어를 지원한다. 특히 노이즈가 섞인 참조 오디오에서도 깨끗한 출력이 가능하며, 한 번에 최대 3분 길이의 긴 오디오 생성도 지원한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @Alibaba_Qwen: Introducing the Qwen-Audio-3.0-TTS. Our latest text-to-speech model, in two flavors: • Flash: real-time interaction • Plus: high-q

원문 보기 ↗
다음 뉴스 →

중요미 의회, AI '킬 스위치' 법안 추진…DHS에 긴급 정지 권한 부여

정부가 AI 시스템 강제 중단·제한 명령 가능. 미국 대상 서비스라면 비상 정지 대응 체계 검토 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스