← promppy_ 실시간 AI 뉴스
참고X

Claude Opus 5, Agent Arena 벤치마크서 2위 기록

실제 에이전트 워크플로우 수행 능력 지표에서 Anthropic의 최신 모델이 상위권 입증.

요약

Anthropic의 Claude Opus 5(Max)가 7,000건 이상의 실사용 에이전트 세션을 바탕으로 평가한 Agent Arena에서 2위를 차지했으며, Claude Opus 5(High)가 바로 뒤인 3위에 올랐다. Claude Opus 5(Max)는 1위인 Fable 5 바로 아래, GPT-5.6 Sol(xHigh)보다는 앞선 성적을 기록했다. 구체적으로 Claude Opus 5(Max)는 11.88%의 순 개선율을 보이며 '확정된 성공(Confirmed Success)' 및 '칭찬 대 불만(Praise vs Complaint)' 지표에서 1위를 기록했다. Claude Opus 5(High)는 11.73%의 순 개선율을 기록하며 3위에 올랐고, 세부 지표인 칭찬 대 불만에서 3위, 확정된 성공에서 4위를 차지했다. Agent Arena는 전 세계 사용자들의 실제 장기 에이전트 작업을 바탕으로 모델을 평가하며, 모델들은 웹 검색, 파일 시스템, 터미널 도구를 활용해 복잡한 워크플로우를 수행한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @arena: Exciting news: @AnthropicAI's Claude Opus 5 (Max) is #2 in Agent Arena, with Opus 5 (High) right behind at #3, based on over 7K re

원문 보기 ↗
다음 뉴스 →

중요xAI, 차세대 음성 에이전트 모델 'Grok Voice Think Fast 2.0' 공개

응답 지연 없이 복잡 질문·도구 호출 처리. 음성 에이전트 구축 팀 벤치마킹 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스