← promppy_ 실시간 AI 뉴스
참고X

Terminal-Bench 3.0 발표: Claude Opus 5 Max 1위 등극

LLM 코딩 역량 벤치마크 결과. 최신 모델 선택 시 참고할 만한 평가 지표.

요약

AI 모델의 성능을 측정하는 벤치마크인 Terminal-Bench 3.0이 새롭게 출시되었다. 이번 평가 결과에서 Claude Opus 5 Max가 43.5%의 점수를 기록하며 업계 최고 수준인 SoTA(State-of-the-Art) 자리에 올랐다. 기존 1위였던 GPT-5.6 Sol은 34.6%의 점수로 2위로 밀려났다. 3위는 34.1%를 기록한 Fable 5가 차지했으며, 이는 GPT-5.6 Sol의 오차 범위 내에 있는 수치다. 이번 벤치마크 업데이트를 통해 최신 LLM 간의 성능 경쟁 구도가 더욱 명확해졌다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @synthwavedd: Terminal-Bench 3.0 has been released! Claude Opus 5 Max takes the crown from GPT-5.6 Sol, achieving a SoTA score of 43.5% to Sol's

원문 보기 ↗
다음 뉴스 →

중요Unsloth, 로컬 모델 구동·학습 통합 데스크톱 앱 출시

오픈소스, VRAM 70% 절감·학습 2배 가속. 사내 온프레미스 파인튜닝 환경 구축 시 검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스