← promppy_ 실시간 AI 뉴스
참고X

코딩 에이전트 하네스(Claude Code 등) 비교 평가: 정확도보다 비용 효율성 확인

Claude Code, Codex, Pi 등 하네스별 SWE-bench Lite 성능은 유사하나 비용 차이가 큼. 에이전트 도입 시 비용 최적화 필수.

요약

최근 7개 AI 모델을 대상으로 Claude Code, Codex, Pi 등 3가지 하네스(harness) 환경에서의 성능을 평가한 결과, 하네스 선택은 작업 성공률보다 비용에 더 큰 영향을 미치는 것으로 나타났다. SWE-bench Lite 기준 Claude Code는 97.8% 정확도에 1.33달러의 비용이 발생한 반면, Pi는 96.7% 정확도에 0.67달러로 절반 수준의 비용을 기록했다. 이는 단순한 하네스라도 경쟁력이 있을 수 있으며, 네이티브 하네스가 항상 최선의 선택은 아님을 시사한다. 따라서 성공률만을 기준으로 하네스를 선택할 경우 불필요한 '하네스 비용(harness tax)'을 지불할 수 있어 주의가 필요하다. 많은 개발자가 코딩 에이전트를 사용하고 있음에도 불구하고, 도구 선택이 실질적인 비용 효율성에 미치는 영향은 그동안 불분명했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @melissapan: Does your Claude model really need Claude Code…? 🤔 We evaluate 7 models on Claude Code, Codex, and Pi. Three surprising findings

원문 보기 ↗

광고

다음 뉴스 →

중요EU, 주요 AI 연구소 초청해 'AI 개발 속도 조절' 회동 추진

AI법에 이어 프런티어 모델 규제 압박 강화. EU 시장 진출 서비스는 규제 리스크 점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스