참고Reddit
경량 음성 복제 모델 'Sopro V2 Turbo 2610' 공개
CPU 환경에서 실시간 5배 속도로 동작하는 120M 파라미터 기반 음성 모델 업데이트. 로컬 오디오 에이전트 개발 시 참고.
요약
음성 합성 모델 Sopro V2 Turbo 2610이 기존 모델에서 발생하던 음성 끊김과 거친 노이즈를 개선하여 업데이트되었다. 120M 파라미터 규모를 유지하면서도, 노트북 CPU 환경에서 실시간보다 5배 빠른 (~300ms) 초기 오디오 생성 속도를 지원한다. 현재 영어, 유럽 포르투갈어, 프랑스어, 독일어를 지원하며 오픈소스 라이선스인 Apache-2.0으로 공개되었다. 높은 음정의 음성이나 만화 캐릭터 같은 비정형 음성 처리에는 여전히 한계가 있으나 지속적인 개선이 진행 중이다. 향후 추가 언어 지원과 음성 생성 제어 기능 강화를 계획하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Sopro V2 Turbo 2610: cleaner cloned voices, same 120M model, 5x faster than real time on CPU
원문 보기 ↗