코딩 에이전트 하네스(Claude Code 등) 비교 평가: 정확도보다 비용 효율성 확인
Claude Code, Codex, Pi 등 하네스별 SWE-bench Lite 성능은 유사하나 비용 차이가 큼. 에이전트 도입 시 비용 최적화 필수.
요약
최근 7개 AI 모델을 대상으로 Claude Code, Codex, Pi 등 3가지 하네스(harness) 환경에서의 성능을 평가한 결과, 하네스 선택은 작업 성공률보다 비용에 더 큰 영향을 미치는 것으로 나타났다. SWE-bench Lite 기준 Claude Code는 97.8% 정확도에 1.33달러의 비용이 발생한 반면, Pi는 96.7% 정확도에 0.67달러로 절반 수준의 비용을 기록했다. 이는 단순한 하네스라도 경쟁력이 있을 수 있으며, 네이티브 하네스가 항상 최선의 선택은 아님을 시사한다. 따라서 성공률만을 기준으로 하네스를 선택할 경우 불필요한 '하네스 비용(harness tax)'을 지불할 수 있어 주의가 필요하다. 많은 개발자가 코딩 에이전트를 사용하고 있음에도 불구하고, 도구 선택이 실질적인 비용 효율성에 미치는 영향은 그동안 불분명했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @melissapan: Does your Claude model really need Claude Code…? 🤔 We evaluate 7 models on Claude Code, Codex, and Pi. Three surprising findings
원문 보기 ↗