참고Reddit
초경량 음성 복제 모델 'Sopro V2 Turbo' 오픈소스 공개 (120M)
CPU 환경에서 실시간 5배 속도로 동작하는 로컬 TTS 모델. 가벼운 음성 합성 기능 구현 시 유용한 대안.
요약
오픈소스 음성 복제 TTS 모델인 Sopro V2 Turbo가 공개되었으며, 120M 파라미터 규모로 CPU 환경에서 실시간보다 5배 빠른 속도로 구동된다. 이 모델은 5~20초 분량의 오디오 샘플만으로 음성 복제가 가능하며, 노트북 CPU 기준 첫 오디오 생성까지 약 300ms가 소요된다. 현재 영어, 유럽 포르투갈어, 프랑스어, 독일어를 지원하며, 로컬 웹 UI를 통해 간편하게 실행할 수 있다. 또한 파이썬 API와 WebGPU/WASM을 위한 브라우저 패키지(@soprotts/onnx-web)를 제공하여 개발 편의성을 높였다. 상세 코드와 벤치마크 결과는 GitHub 저장소와 Haloneuro AI 연구 블로그에서 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 We open-sourced Sopro V2 Turbo - a 120M voice cloning TTS model that runs 5x faster than real time on CPU
원문 보기 ↗