중요Hacker News
구글, 실시간 고정밀 음성인식 모델 'Gemini 3.5 Transcribe' 공개
잡음·전문용어·말더듬 자동 정리 강점. 국내 STT 파이프라인 정확도 벤치마크 재검토 필요.
요약
구글은 배경 소음, 복잡한 전문 용어, 비유창한 언어 처리에 최적화된 새로운 음성 인식 모델 'Gemini 3.5 Transcribe'를 공개했다. 이 모델은 원시 오디오를 즉시 정확하고 정돈된 텍스트로 변환하며, 실시간 언어 전환 및 스트리밍 전사를 지원한다. 현재 Gemini 앱, Android의 Rambler, macOS용 Gemini 앱 등에 적용되어 서비스되고 있다. 개발자들은 이제 Gemini API(Google AI Studio)와 Gemini Enterprise Agent Platform을 통해 자사 워크플로우에 이 기술을 통합할 수 있다. 음성 에이전트, 실시간 자막 도구, 통화 후 분석 파이프라인 구축 등 다양한 분야에서 활용 가능하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Gemini-3.5-Transcribe
원문 보기 ↗