Claude Opus 5, Artificial Analysis 지능 지수 근소 1위…에이전트 지식노동서 압도
GDPval·에이전트 벤치마크 1위에 태스크당 비용 26% 저렴. 지식노동 자동화 파일럿 재검토 가치.
요약
Anthropic의 Claude Opus 5가 Artificial Analysis Intelligence Index에서 61점을 기록하며 1위 모델로 등극했습니다. 이번 모델은 Claude Fable 5(60점) 및 GPT-5.6 Sol(59점)을 근소하게 앞섰으며, 특히 에이전트 지식 업무 수행 능력인 GDPval-AA v2(1861 Elo)와 AA-Briefcase(1720 Elo)에서 압도적인 성능을 보였습니다. 비용 측면에서 Claude Opus 5(max)는 인텔리전스 인덱스 작업당 평균 2.03달러의 비용이 발생해 Claude Fable 5(2.75달러)보다 효율적인 모습을 보였습니다. 또한, Claude Code를 결합했을 때 Artificial Analysis 코딩 인덱스에서 1위를 차지했으며, SWE-Atlas-QnA에서 최고 점수를 기록했습니다. 다만, AA-Omniscience 기준 사실적 지식 정확도는 Claude Fable 5보다 낮고 환각 비율이 50%까지 상승하는 등 일부 과제에서는 한계를 보였습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ArtificialAnlys: Claude Opus 5 is narrowly the most intelligent model on the Artificial Analysis Intelligence Index, offering comparable intelligen
원문 보기 ↗