참고팁Reddit
오픈소스 TTS 모델 'TontaubeV1' 출시… 캐릭터 단위 토큰화 도입
표현력과 낮은 지연시간에 집중한 2.9B TTS 모델, 로컬 추론 환경 구축 시 대안으로 고려 가능.
요약
TontaubeV1은 2.9B 파라미터 규모의 오픈 웨이트 TTS 모델로, 표현력이 풍부한 음성 생성과 긴 문장 서사, 로컬 환경에서의 저지연 추론에 최적화되었다. 이 모델은 멀티 코드북 이산 오디오 코덱인 DualCodec을 기반으로 설계되었으며, 영어와 독일어를 중심으로 7개 언어, 약 20만 시간의 오디오 데이터로 학습되었다. 최대 1분 분량의 레퍼런스 오디오를 활용한 제로샷 음성 복제가 가능하며, 특히 음소 단위가 아닌 캐릭터 단위 토큰화 방식을 채택했다는 점이 특징이다. 또한 Qwen3-1.7B 체크포인트를 기반으로 시맨틱 코드북 모델을 구축하여 성능을 향상시켰다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 We released TontaubeV1, a character-level TTS model for long-form generation [P]
원문 보기 ↗