과학 연구 특화 에이전트 벤치마크 'Terminal-Bench-Science 0.1' 공개
과학 연구 분야 에이전트의 실무 능력을 평가하는 지표. 연구용 에이전트 도입 및 모델 성능 검증 시 참고할 만한 최신 데이터.
요약
Artificial Analysis는 과학 연구를 위한 에이전트 벤치마크인 'Terminal-Bench-Science 0.1' 리더보드를 출시했다. 2026년 8월 스탠퍼드 연구진 등이 개발한 이 벤치마크는 생명, 물리, 수학, 공학, 지구과학 등 5개 분야의 전문가 검수 과제 70개로 구성되며, 샌드박스 환경에서 에이전트의 수행 능력을 평가한다. 현재 GPT-6 Astra(max)가 63%, Claude Opus 5.5(xhigh)가 62%의 성공률을 기록하며 최상위권을 차지했으나, 두 모델을 제외하면 50%를 넘지 못해 여전히 높은 개선 여지가 존재한다. 특히 생명 과학 분야에서 모델들의 성과가 가장 낮게 나타났으며, 수학 과학 분야에서는 Claude Opus 5.5(xhigh)가 71%의 성공률을 보이는 등 분야별 편차를 보였다. 반면 GLM-5.3(max) 10%, DeepSeek V4.1 Flash(max) 9% 등 오픈 웨이트 모델들은 선두 모델 대비 50%포인트 이상 낮은 성능을 기록했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ArtificialAnlys: Today we’re launching our leaderboard for Terminal-Bench-Science 0.1, an agentic benchmark for scientific research work. GPT-6 Ast
원문 보기 ↗