Deepgram, Flux TTS로 구현하는 대화형 보이스 AI의 상태 유지 기법
음성 AI에서 턴 간 대화 문맥 및 음성 일관성을 유지하며 200ms 미만의 지연 시간을 달성하는 기술적 접근 방식.
요약
최근 AI 음성 기술은 단순히 10초 샘플의 자연스러움을 넘어, 전체 대화 맥락을 유지하는 'ChatGPT 모멘트' 단계로 진입하고 있다. 실시간 음성 에이전트는 사용자의 질문 변경이나 중간 끊김에도 어조와 속도를 일정하게 유지해야 하며, 이를 위해 LLM의 대화 기억 능력과 음성 모델의 일관된 음향 상태 유지가 필수적이다. Deepgram의 Flux TTS는 지속적인 스트리밍 세션 내부에서 음향 상태를 관리하여 첫 오디오를 200ms 이내에 생성하고, 재생 중단 지점을 파악해 정확한 대화 이력을 LLM에 전달하는 방식으로 문제를 해결한다. 최근 약 14,400회의 블라인드 테스트에서 Flux는 73.4%의 자연스러움 승률을 기록하며 Cartesia Sonic 3.5(72.0%)를 앞섰다. 이러한 기술 발전을 통해 실제 상담 환경에서 사용자의 요구 변화와 후속 질문을 자연스럽게 처리하는 음성 AI 구현이 가능해졌다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @_avichawla: This is the ChatGPT moment for Voice AI. A ten-second sample can show that a synthetic voice sounds natural. But it tells little a
원문 보기 ↗