구글, 초표현형 음성 모델 Gemini 3.8 Flash TTS·Flash-Lite TTS 공개
억양·감정까지 지시하는 커스텀 보이스 생성. 오디오북·게임·팟캐스트 TTS 파이프라인 재검토 대상.
요약
구글 딥마인드가 표현력이 대폭 향상된 새로운 텍스트 음성 변환(TTS) 모델인 'Gemini 3.8 Flash TTS'와 'Gemini 3.8 Flash-Lite TTS'를 출시했다. 이번 모델은 기존의 정적인 음성 프리셋을 넘어 사용자가 직접 캐릭터의 억양과 감정 톤을 세밀하게 조정할 수 있는 동적 생성 기능을 제공한다. 해당 기술은 Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, Google Vids 등 다양한 플랫폼에서 즉시 활용 가능하다. 기존의 30개 음성을 넘어 무제한에 가까운 독창적인 음성 생성이 가능해 오디오북, 게임, 팟캐스트 제작 등 다방면에서 활용도가 높다. 구글은 Gemini 3.5 Live Translate 및 3.8 Live 등 기존 오디오 라인업과 함께 안전 기능을 강화하여 책임감 있는 음성 생성을 지원할 방침이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Gemini 3.8 text-to-speech says hello
원문 보기 ↗