'Caveman' 토큰 최적화 도구, 실제 벤치마크 결과 8.5% 개선
단순 출력 압축보단 전체 에이전트 컨텍스트 관리 효율이 중요함을 시사하는 실무 결과.
요약
코딩 에이전트의 출력 토큰 사용량을 줄이기 위한 'Caveman' 방식이 초기 벤치마크에서는 약 65%의 절감 효과를 보였으나, JetBrains의 독립적인 테스트 결과 8.5% 절감에 그쳤다. JetBrains는 장기 코딩 작업에서 해당 방식을 검증한 결과, 태스크 품질 저하는 발생하지 않았음을 확인했다. 성능 차이가 발생한 이유는 전체 트래픽 중 모델 출력값이 차지하는 비중이 실제 작업 환경에서 예상보다 적었기 때문이다. 에이전트 요청에는 대화 이력, 소스 파일, 로그, 도구 결과 등 방대한 컨텍스트가 포함되어 있어 단순 출력 압축만으로는 한계가 있었다. 이를 해결하기 위해 개발자는 최적화 방식을 에이전트 하네스 하단으로 이동시켜, 프로바이더 호출 전 로컬 Caveman 프록시에서 컨텍스트를 압축하거나 재구성하는 구조로 변경했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 My Caveman 65% output-token claim got 8.5% in an independent benchmark
원문 보기 ↗