Qwen2.5-Coder 등 주요 모델, 도구 호출(Tool-call) 성능 저조
에이전트 구현 시 네이티브 함수 호출 기능보다 텍스트 기반 파싱이 더 안정적일 수 있음을 시사하는 벤치마크 결과.
요약
한 개발자가 Ollama 환경에서 다양한 AI 모델의 도구 호출(Tool-call) 신뢰성을 벤치마크한 결과, Qwen2.5-coder를 제외한 모델들이 0%의 성공률을 기록했다. 실험은 6개의 코딩 과제를 모델당 3회씩 총 18회 수행하는 방식으로 진행되었으며, pi, Hermes Agent, Goose 모두 단 한 건의 도구 호출도 성공하지 못했다. 특히 Linux Foundation이 주도하고 AWS, Anthropic 등이 지원하는 Goose조차 도구 호출 오류 해결책인 GOOSE_TOOLSHIM을 적용했음에도 0%의 완료율을 보였다. 반면 Qwen2.5-coder:7b 모델은 39%의 작업 완료율을 기록하며 상대적으로 우수한 성능을 나타냈다. 이 실험 결과는 네이티브 함수 호출 기능에 의존하기보다, 모델의 일반 텍스트 출력에서 도구 호출을 직접 파싱하는 방식의 유효성을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I benchmarked tool-call reliability on qwen2.5-coder against pi, Hermes, and Goose - all three got 0%
원문 보기 ↗