참고X
Terminal-Bench 3.0 발표: Claude Opus 5 Max 1위 등극
LLM 코딩 역량 벤치마크 결과. 최신 모델 선택 시 참고할 만한 평가 지표.
요약
AI 모델의 성능을 측정하는 벤치마크인 Terminal-Bench 3.0이 새롭게 출시되었다. 이번 평가 결과에서 Claude Opus 5 Max가 43.5%의 점수를 기록하며 업계 최고 수준인 SoTA(State-of-the-Art) 자리에 올랐다. 기존 1위였던 GPT-5.6 Sol은 34.6%의 점수로 2위로 밀려났다. 3위는 34.1%를 기록한 Fable 5가 차지했으며, 이는 GPT-5.6 Sol의 오차 범위 내에 있는 수치다. 이번 벤치마크 업데이트를 통해 최신 LLM 간의 성능 경쟁 구도가 더욱 명확해졌다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @synthwavedd: Terminal-Bench 3.0 has been released! Claude Opus 5 Max takes the crown from GPT-5.6 Sol, achieving a SoTA score of 43.5% to Sol's
원문 보기 ↗