음성 에이전트용 오픈 모델 'PhoneLLM' 공개
GPT-5.6급 성능을 1/3 지연·1/18 비용으로. 저지연 보이스 에이전트 구축 시 검토 가치.
요약
음성 에이전트 전용 오픈 모델인 PhoneLLM이 공개되었습니다. 이 모델은 NVIDIA Nemotron Nano 30B를 기반으로 미세 조정되었으며, 실시간 음성 대화 환경에서 GPT-5.6 Terra 수준의 성능을 보여주면서도 기존 대비 지연 시간은 1/3, 비용은 1/18 수준으로 낮췄습니다. 특히 '사고 과정(Thinking)' 기능을 배제하고 학습하여 실시간 음성 상호작용에 필수적인 낮은 지연 시간을 확보한 것이 특징입니다. NVIDIA B200 서버 하나당 80개 이상의 에이전트를 동시에 구동할 수 있으며, 종단 간 지연 시간(TTFAT)을 P95 기준 600ms 이하로 유지하면서 분당 약 0.0025달러의 저렴한 비용으로 운영 가능합니다. 현재 허깅페이스에서 모델 가중치를 확인할 수 있으며, Modal을 통한 원클릭 배포 및 스타터 프로젝트 리포지토리가 제공됩니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kwindla: Introducing PhoneLLM, an open model for voice agents. GPT 5.6 Terra performance on typical voice agent tasks at 1/3 the latency an
원문 보기 ↗