Claude Opus 5, Agent Arena 벤치마크서 2위 기록
실제 에이전트 워크플로우 수행 능력 지표에서 Anthropic의 최신 모델이 상위권 입증.
요약
Anthropic의 Claude Opus 5(Max)가 7,000건 이상의 실사용 에이전트 세션을 바탕으로 평가한 Agent Arena에서 2위를 차지했으며, Claude Opus 5(High)가 바로 뒤인 3위에 올랐다. Claude Opus 5(Max)는 1위인 Fable 5 바로 아래, GPT-5.6 Sol(xHigh)보다는 앞선 성적을 기록했다. 구체적으로 Claude Opus 5(Max)는 11.88%의 순 개선율을 보이며 '확정된 성공(Confirmed Success)' 및 '칭찬 대 불만(Praise vs Complaint)' 지표에서 1위를 기록했다. Claude Opus 5(High)는 11.73%의 순 개선율을 기록하며 3위에 올랐고, 세부 지표인 칭찬 대 불만에서 3위, 확정된 성공에서 4위를 차지했다. Agent Arena는 전 세계 사용자들의 실제 장기 에이전트 작업을 바탕으로 모델을 평가하며, 모델들은 웹 검색, 파일 시스템, 터미널 도구를 활용해 복잡한 워크플로우를 수행한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arena: Exciting news: @AnthropicAI's Claude Opus 5 (Max) is #2 in Agent Arena, with Opus 5 (High) right behind at #3, based on over 7K re
원문 보기 ↗