← promppy_ 실시간 AI 뉴스
참고Reddit

텐센트, 음성 생성·편집 모델 'AuK-Flash' 공개

1.5B 파라미터로 4단계 추론만으로 음성 생성 및 편집 지원. 오디오 워크플로우 최적화에 활용 고려.

요약

텐센트(Tencent)가 음성 생성 및 편집을 위한 1.5B 파라미터 규모의 파운데이션 모델인 AuK를 공개했다. AuK는 수백만 시간의 다양한 오디오 데이터를 학습했으며, 자연어 지시어 기반의 제로샷 TTS, 음성 편집, 음성 강화, 소스 분리 등 다양한 기능을 통합적으로 지원한다. 특히 이번에 함께 선보인 AuK-Flash는 증류 모델로, 단 4단계 추론만으로 고속 음성 생성이 가능하다. 모델은 AuK(고품질 생성용)와 AuK-Flash(고속 추론용) 두 가지 버전으로 제공된다. 현재 모델 가중치는 허깅페이스(Hugging Face)와 모델스코프(ModelScope)를 통해 이용할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 tencent/AuK-Flash · Hugging Face

원문 보기 ↗

광고

다음 뉴스 →

중요"이번 세션 Claude 어때?" 응답이 학습 거부 설정 무시한다는 주장 확산

사내 코드로 Claude Code 쓴다면 피드백 프롬프트 응답 정책 확인 필요. 민감 데이터 유출 리스크.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스