코드베이스 최적화 도구 5종 벤치마크: 마케팅 수치와 실제 성능 차이 분석
토큰 절감 도구들의 실제 성능 검증. 에이전트 구축 시 도구 선택의 객관적 기준 제공.
요약
최근 코드베이스 도구들의 토큰 절감률 주장이 실제 에이전트 작업 환경에서는 과장된 것으로 나타났다. JetBrains의 조사 결과 Caveman은 65% 절감을 주장했으나 실제로는 8.5%에 그쳤고, RTK는 오히려 비용이 증가했으며 Greptile의 82% 절감 주장 역시 45%로 재측정되었다. 이에 대한 검증을 위해 SWE-bench에서 추출한 15개의 Django 질문을 바탕으로 5개 코드베이스 도구와 도구 미사용(no-tools) 환경을 비교하는 벤치마크가 수행되었다. 총 180회의 테스트 결과, 기존 마케팅 수치와 실제 성능 사이의 큰 괴리가 확인되었다. 실무자들은 코드베이스 도구 선택 시 단순 홍보 문구보다 실제 워크로드 기반의 성능 데이터를 면밀히 검토할 필요가 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I benchmarked 5 codebase tools across Claude Code and Codex. The 60–90% token-saving claims didn’t hold up.
원문 보기 ↗