Claude Opus 5, 에이전트 지식 업무 벤치마크 'AA-Briefcase' 1위 등극
Fable 5 대비 Elo 146점↑·태스크당 비용 20%↓. 에이전트 워크플로우 모델 교체 검토 가치.
요약
Anthropic이 새롭게 출시한 Claude Opus 5가 Artificial Analysis의 에이전트 업무 벤치마크인 AA-Briefcase에서 1,720점의 Elo를 기록하며 1위에 올랐습니다. 이는 기존 선두 모델인 Claude Fable 5(1,574점)를 146점 앞선 수치입니다. 특히 Claude Opus 5는 작업당 비용을 Claude Fable 5 대비 20% 절감했으며, xhigh 및 high 설정은 성능 우위와 함께 비용 효율성 측면에서 더욱 뛰어난 성능을 보입니다. 이번 벤치마크 결과에 따르면 Claude Opus 5의 성능 향상은 주로 루브릭 통과율과 분석 품질 개선에 기인한 것으로 나타났습니다. Anthropic은 이번 신규 모델을 통해 AA-Briefcase 리더보드 상위권을 장악하며 에이전트 지식 업무 분야에서 독보적인 경쟁력을 확보했습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ArtificialAnlys: Claude Opus 5 is the new leader on our agentic knowledge work benchmark, AA-Briefcase, outperforming Claude Fable 5 by nearly 150
원문 보기 ↗