OpenAI, API용 음성 변환 모델 2종 공개 — 실시간·배치 특화
GPT-Live-Transcribe(저지연)/GPT-Transcribe(배치) 분리. 억양·전문용어·소음 환경 정확도 개선, STT 파이프라인 재검토 가치.
요약
OpenAI가 API를 통해 새로운 음성 인식 모델인 GPT-Live-Transcribe와 GPT-Transcribe 2종을 출시했다. GPT-Live-Transcribe는 실시간 음성 인식을 위한 저지연 환경에 최적화되었으며, GPT-Transcribe는 완성된 오디오 파일 및 배치 작업의 비동기 처리에 특화된 모델이다. 두 모델 모두 이전보다 향상된 문맥 이해력을 바탕으로 다양한 억양과 언어는 물론 짧은 문구, 숫자, 전문 용어까지 정확하게 인식한다. 특히 소음이 심한 실제 환경에서도 높은 음성 인식 성능을 제공하도록 설계되었다. 개발자는 API를 통해 상황에 맞는 모델을 선택하여 더욱 정교한 음성 기반 애플리케이션을 구축할 수 있게 됐다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @OpenAIDevs: We're introducing two new transcription models in the API: • GPT-Live-Transcribe: built for low-latency live transcription. • GPT-
원문 보기 ↗