참고팁Reddit
[Reddit] 개인 GPU(3090)로 하룻밤 만에 학습한 20M TTS 모델 공개
초소형 모델로도 음성 합성 구현이 가능함을 보여준 사례, 로컬 AI 연구용으로 참고 가능.
요약
Reddit의 r/LocalLLM 커뮤니티에서 단일 RTX 3090 GPU를 사용하여 하룻밤 만에 학습시킨 20M 파라미터 규모의 오픈소스 TTS(Text-to-Speech) 모델인 ttslibre가 공개되었다. 개발자 FranciscoCarlosErra는 학습 코드와 모델 가중치 및 학습 데이터셋을 GitHub와 Hugging Face를 통해 각각 배포했다. 현재 모델은 아직 초기 단계로 다소 기계적인 음성을 생성하는 등 불안정한 모습을 보이나, 소규모 리소스만으로 TTS 모델을 처음부터 학습시킬 수 있음을 입증한 개념 증명(PoC) 사례로 주목받고 있다. 관심 있는 실무자들은 공개된 레포지토리를 통해 코드와 데이터를 직접 확인하고 활용할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 It's ALIVE! Tiny 20M FOSS TTS Trained overnight from scratch on a single 3090
원문 보기 ↗