에이전트 하네스별 토큰 효율성 비교: 최대 30배 비용 차이
Claude Code, Hermes, Kimi Code 간 토큰 소모량 실측 비교로 에이전트 설계 시 비용 최적화 기준을 제시합니다.
요약
Composio는 Kimi K3 모델을 Claude Code, Hermes, Kimi Code 등 3가지 에이전트 하네스에서 동일한 28개 작업으로 테스트한 결과를 발표했다. 세 가지 하네스 모두 작업 성공률은 유사했으나, 하네스에 따라 토큰 효율성에서 최대 30배까지 차이가 발생하는 것으로 나타났다. 중간값 기준 토큰 소모량은 Kimi Code가 61k, Hermes가 67k인 반면, Claude Code는 340k로 약 6배 더 많은 토큰을 소비했다. Kimi K3의 1M 토큰당 입력 비용인 3달러를 적용했을 때, 작업당 평균 비용은 Kimi Code 0.22달러, Hermes 0.28달러, Claude Code 2달러로 큰 격차를 보였다. 이번 실험은 에이전트 환경 구성에 따라 동일 모델이라도 운영 비용 효율성이 크게 달라질 수 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @composio: We ran Kimi K3 through 3 agent harnesses (Claude Code, Hermes, Kimi Code) on 28 identical tasks. All 3 harnesses completed the tas
원문 보기 ↗