← promppy_ 실시간 AI 뉴스
중요Google DeepMind

구글, 실시간 음성 인식 모델 'Gemini 3.5 Transcribe' 공개

소음·전문용어·말더듬 자동 정제까지 지원. 음성 자막·에이전트 구축 시 STT 파이프라인 재검토 가치 있음.

요약

구글 딥마인드가 정밀한 실시간 음성-텍스트 변환을 위한 최신 모델인 Gemini 3.5 Transcribe를 공개했다. 이 모델은 배경 소음과 복잡한 전문 용어, 불완전한 문장까지 정교하게 처리하여 원본 오디오를 즉시 깔끔하고 정돈된 텍스트로 변환한다. 기존 음성 인식 모델의 한계를 극복하고 사용자의 자연스러운 말투와 의도를 파악하며 실시간 언어 전환을 지원하는 것이 특징이다. 현재 Gemini 앱과 안드로이드의 Rambler 등의 기능에 적용되어 있으며, 개발자들은 이제 Gemini API, Google AI Studio, Gemini Enterprise Agent Platform을 통해 이를 활용할 수 있다. 음성 에이전트 구축부터 실시간 자막 생성, 통화 후 분석 파이프라인 개발까지 다양한 워크플로우에 원활하게 통합 가능하다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Intelligent transcription with Gemini 3.5 Transcribe

원문 보기 ↗
다음 뉴스 →

중요소문: Fable 5.1과 Claude Sonnet 5.1 동시 출시 임박

Sonnet 5.1 나오면 벤치·가격 재점검 필요. 아직 루머 단계니 공식 발표 확인 후 대응.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

다른 매체 보도

관련 뉴스

최신 뉴스