참고X
Claude Opus 5, SWE-Bench 97% 기록
소프트웨어 엔지니어링 벤치마크에서 최고 수준의 성능 입증, 에이전트 성능 지표 재확인.
요약
Anthropic의 신규 모델 Claude Opus 5가 소프트웨어 엔지니어링 벤치마크인 SWE-Bench에서 97%의 점수를 기록하며 1위에 올랐다. 해당 모델은 Fable 5 수준의 인텔리전스를 기존 대비 절반 가격에 제공한다고 주장한다. 이번 모델 출시로 Anthropic은 불과 한 달 만에 업계의 판도를 바꾸는 혁신을 이어가고 있다. AI 분야에서 SOTA 모델의 성능 개선 속도가 전례 없이 빨라지고 있으며, 이러한 기술 발전의 속도는 앞으로 더욱 가속화될 것으로 전망된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @cline: Claude Opus 5 takes #1 on SWE-Bench at 97%, and claims Fable 5 level intelligence at half the price. Incredible that in only 1 mon
원문 보기 ↗