에이전트 벤치마크는 모델 성능인가, 하네스(Harness) 성능인가?
Grok 4.6과 CursorBench 결과를 통해, 에이전트 성능 평가 시 프롬프트와 시스템 구조가 미치는 영향에 대한 통찰을 제공.
요약
최근 공개된 Grok 4.6 Extra High는 CursorBench 3.2에서 70.8%의 점수를 기록하며 Fable 5 Max(70.5%)와 유사한 성능을 보였으나 비용은 $2.81/task로 더 효율적이다. 그러나 업계에서는 현재의 벤치마크 점수가 모델 자체의 성능인지, 혹은 이를 구동하는 Cursor의 에이전트 시스템(도구, 컨텍스트 관리, 재시도 전략 등)의 기여인지에 대한 의문을 제기하고 있다. Grok 4.6은 개발 과정에서 다양한 에이전트 환경의 궤적을 학습 데이터로 활용하며 모델과 시스템 간의 경계를 모호하게 만들었다. 결과적으로 에이전트 성능 평가가 모델 고유의 능력뿐만 아니라 시스템 환경 최적화까지 복합적으로 반영하고 있어, 단순 점수 비교 이상의 심층적인 분석이 필요한 시점이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Grok 4.6 made me wonder: how much of CursorBench is the model, and how much is the harness?
원문 보기 ↗