중요AI타임스
OpenAI, 동시에 듣고 말하는 전이중 음성 AI 'GPT-Live' 공개
턴 디텍터 제거·추론 비동기 호출로 초저지연 실현. 음성 대화 서비스 아키텍처 재설계 참고감.
요약
오픈AI가 3일(현지시간) 차세대 음성 AI 아키텍처 'GPT-라이브(GPT-Live)'의 핵심 기술을 공개했다. 기존 음성 AI의 고질적 문제였던 '차례를 기다리는 대화' 방식을 탈피하여, 사람처럼 동시에 듣고 말하는 전이중(Full-Duplex) 방식의 음성 AI 시스템을 구축했다. 이번 아키텍처는 대화 도중 실시간으로 음성을 주고받으면서 필요할 때만 최상위 추론 모델을 비동기적으로 호출하는 구조를 채택했다. 이를 통해 턴 디텍터(Turn Detector) 없이도 지연 시간을 최소화하여 더욱 자연스럽고 인간과 유사한 대화 경험을 구현하는 데 성공했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 턴 디텍터 없애고 추론 분리... 오픈AI가 밝힌 'GPT-라이브' 초저지연 비밀
원문 보기 ↗