참고Reddit
텐센트, 음성 생성·편집 모델 'AuK-Flash' 공개
1.5B 파라미터로 4단계 추론만으로 음성 생성 및 편집 지원. 오디오 워크플로우 최적화에 활용 고려.
요약
텐센트(Tencent)가 음성 생성 및 편집을 위한 1.5B 파라미터 규모의 파운데이션 모델인 AuK를 공개했다. AuK는 수백만 시간의 다양한 오디오 데이터를 학습했으며, 자연어 지시어 기반의 제로샷 TTS, 음성 편집, 음성 강화, 소스 분리 등 다양한 기능을 통합적으로 지원한다. 특히 이번에 함께 선보인 AuK-Flash는 증류 모델로, 단 4단계 추론만으로 고속 음성 생성이 가능하다. 모델은 AuK(고품질 생성용)와 AuK-Flash(고속 추론용) 두 가지 버전으로 제공된다. 현재 모델 가중치는 허깅페이스(Hugging Face)와 모델스코프(ModelScope)를 통해 이용할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 tencent/AuK-Flash · Hugging Face
원문 보기 ↗