참고Reddit
에이전트 성능 비교의 객관성 확보를 위한 '블라인드 벤치마크' 프로젝트 등장
다양한 에이전트 환경을 공정하게 평가하기 위해 개발된 오픈소스 블라인드 벤치마크 툴.
요약
AI 에이전트 도구인 Claude Code, Codex, Hermes, OpenClaw 등의 성능을 공정하게 비교하기 위한 오픈소스 프로젝트인 'Harness Arena'가 공개되었다. 기존 비교 방식은 모델, 프롬프트, 환경 등 변수가 제각각이라 결과의 신뢰성이 낮다는 문제점을 해결하고자 고안되었다. 이 프로젝트는 여러 에이전트 도구에 동일한 과제를 부여하고 독립적인 격리 환경에서 실행하여 결과물을 수집한다. 도출된 결과물은 익명 상태로 평가받으며, 투표 후에야 실제 도구명이 공개되는 블라인드 테스트 방식을 취한다. 최종 결과는 Elo 점수 기반의 리더보드로 제공되며, 현재 MIT 라이선스로 오픈소스화되어 누구나 참여 가능하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I built an open-source blind benchmark for AI agent harnesses - how would you make the comparison fair?
원문 보기 ↗