중요Google DeepMind
구글, 실시간 음성 인식 모델 'Gemini 3.5 Transcribe' 공개
소음·전문용어·말더듬 자동 정제까지 지원. 음성 자막·에이전트 구축 시 STT 파이프라인 재검토 가치 있음.
요약
구글 딥마인드가 정밀한 실시간 음성-텍스트 변환을 위한 최신 모델인 Gemini 3.5 Transcribe를 공개했다. 이 모델은 배경 소음과 복잡한 전문 용어, 불완전한 문장까지 정교하게 처리하여 원본 오디오를 즉시 깔끔하고 정돈된 텍스트로 변환한다. 기존 음성 인식 모델의 한계를 극복하고 사용자의 자연스러운 말투와 의도를 파악하며 실시간 언어 전환을 지원하는 것이 특징이다. 현재 Gemini 앱과 안드로이드의 Rambler 등의 기능에 적용되어 있으며, 개발자들은 이제 Gemini API, Google AI Studio, Gemini Enterprise Agent Platform을 통해 이를 활용할 수 있다. 음성 에이전트 구축부터 실시간 자막 생성, 통화 후 분석 파이프라인 개발까지 다양한 워크플로우에 원활하게 통합 가능하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Intelligent transcription with Gemini 3.5 Transcribe
원문 보기 ↗