정량 분석 에이전트 벤치마크 'AA-AnalystAgent' 공개
실무 분석 업무에서 에이전트의 일관성과 판단력을 측정하는 신규 벤치마크. 에이전트 워크플로우 검증 시 pass^5 지표 참고.
요약
Artificial Analysis는 실제 스프레드시트와 문서를 분석하는 에이전트 성능을 평가하는 신규 벤치마크 'AA-AnalystAgent'를 공개했다. 14개 비즈니스 및 과학 분야의 80개 문항으로 구성된 이 벤치마크는 모델의 정량적 능력뿐만 아니라 전문적인 판단력과 일관성을 평가하며, 5회 반복 시도하여 모두 성공해야 통과하는 'pass^5(pass-all-5)'를 핵심 지표로 삼는다. 평가 결과 Claude Opus 5가 54%로 1위를 차지했으며, GPT-5.5(50%)와 Claude Fable 5(49%)가 그 뒤를 이었다. 특히 최고 성능 모델들 간의 격차는 단순 능력보다 신뢰성에서 발생했는데, GPT-5.5는 평균 성공률인 pass@1에서 우위를 보였으나 Claude Opus 5는 반복 일관성 지표인 pass^5에서 더 높은 성과를 냈다. 모델들의 주요 실패 원인으로는 초기 분석 단계에서 잘못된 해석을 고수하는 사례가 전체 실패의 57%를 차지하는 것으로 나타났다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ArtificialAnlys: Announcing AA-AnalystAgent, our new agentic benchmark for quantitative analysis on real-world spreadsheets & documents. Claude Opu
원문 보기 ↗