9B 모델 라우팅 벤치마크: Nimble 9B vs Qwen 3.5(큐원 3.5)-9B
의사결정 자동화 시 신뢰도 보정(confidence calibration)이 전체 정확도보다 더 중요할 수 있음을 입증.
요약
Reddit의 r/LLMDevs 커뮤니티에서 Nimble 9B 모델과 베이스 모델인 Qwen 3.5-9B의 성능을 비교한 벤치마크 결과가 공유되었습니다. 900개의 실제 고객 불만 사항을 9개 팀으로 분류하는 테스트를 진행한 결과, 전체 정확도는 Nimble 9B 77.1%, Qwen 3.5-9B 76.3%로 비슷하게 나타났습니다. 8비트 하드웨어 환경에서 처리 속도 또한 각각 약 2.25초와 2.07초로 거의 동일했습니다. 그러나 95% 정확도 기준의 자동화 처리 가능 비율을 비교했을 때, Nimble 9B는 43%의 트래픽을 처리한 반면 Qwen 3.5-9B는 16%에 그쳤습니다. 결과적으로 Nimble 9B는 적절한 신뢰도 보정(Confidence calibration)을 통해 프로덕션 환경의 자동 의사결정 라우팅에서 2.7배 더 효과적인 성능을 보였습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Evaluating Nimble 9B vs Qwen 3.5-9B: Why confidence calibration matters for decision routing models
원문 보기 ↗