코드 RAG 성능 측정 벤치마크 탐색: 정확도 평가를 위한 지표 고민
비용 절감만으로는 부족한 RAG 성능 평가의 맹점을 짚어주며, 적절한 벤치마크 선택의 중요성을 시사.
요약
오픈소스 에이전트 하네스 운영자가 코드 지식 그래프를 활용한 검색이 기존 grep-then-read 방식보다 '함수 호출자 찾기'에서 토큰 비용을 75~82% 절감한다는 벤치마크 결과를 공개했습니다. 하지만 해당 벤치마크는 오직 비용 효율성만을 측정할 뿐, 실제 검색의 정확도나 재현율을 검증하지 못한다는 지적이 제기되었습니다. 작성자는 이 한계를 인정하고 문서를 수정했으며, 현재 비용 절감과 검색 정확도를 동시에 평가할 수 있는 벤치마크를 찾고 있습니다. 댓글을 통해 CodeRAG-Bench, CoIR-Retrieval, ContextBench, SWE-Explore-Bench 등이 대안으로 언급되었습니다. 코드 검색 기반 에이전트 개발 시 비용 효율성만큼이나 '올바른 호출자 식별' 여부를 평가할 수 있는 정량적 지표 확보가 중요해지고 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I published a token-cost benchmark for code-graph retrieval. It measures no accuracy. Which benchmark would you run?
원문 보기 ↗