중요AI타임스
알리바바, 대화 타이밍까지 판단하는 전이중 음성 AI 'Qwen-Audio-3.1-Realtime' 공개
끼어들기·대기 등 자연스러운 실시간 상호작용 강점. 음성 에이전트 구축 시 GPT-4o Realtime 대안으로 검토 가치.
요약
알리바바가 지난 23일(현지시간) 사용자의 대화 타이밍과 행동을 스스로 판단하는 차세대 전이중 음성 AI 모델 ‘Qwen-Audio-3.1-Realtime’을 출시했다. 이 모델은 단순히 음성을 인식하고 답변하는 것을 넘어, 대화 중 적절한 끼어들기나 말 끊기 없이 대기하는 등 사람 간의 상호작용과 유사한 자연스러운 반응을 구현한다. 전이중(Full-Duplex) 방식을 채택해 AI가 사용자의 말을 듣는 동시에 주변 음성을 파악하고 필요한 시점에 실시간으로 대응할 수 있다. 이번 기술 공개로 AI는 단순한 질의응답 기능을 넘어 실제 대화 흐름을 이해하고 판단하는 수준으로 진화했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 알리바바, 대화 타이밍까지 판단하는 음성 AI ‘큐원-오디오-3.1-리얼타임’ 공개
원문 보기 ↗