← promppy_ 실시간 AI 뉴스
참고X

과학 연구 특화 에이전트 벤치마크 'Terminal-Bench-Science 0.1' 공개

과학 연구 분야 에이전트의 실무 능력을 평가하는 지표. 연구용 에이전트 도입 및 모델 성능 검증 시 참고할 만한 최신 데이터.

요약

Artificial Analysis는 과학 연구를 위한 에이전트 벤치마크인 'Terminal-Bench-Science 0.1' 리더보드를 출시했다. 2026년 8월 스탠퍼드 연구진 등이 개발한 이 벤치마크는 생명, 물리, 수학, 공학, 지구과학 등 5개 분야의 전문가 검수 과제 70개로 구성되며, 샌드박스 환경에서 에이전트의 수행 능력을 평가한다. 현재 GPT-6 Astra(max)가 63%, Claude Opus 5.5(xhigh)가 62%의 성공률을 기록하며 최상위권을 차지했으나, 두 모델을 제외하면 50%를 넘지 못해 여전히 높은 개선 여지가 존재한다. 특히 생명 과학 분야에서 모델들의 성과가 가장 낮게 나타났으며, 수학 과학 분야에서는 Claude Opus 5.5(xhigh)가 71%의 성공률을 보이는 등 분야별 편차를 보였다. 반면 GLM-5.3(max) 10%, DeepSeek V4.1 Flash(max) 9% 등 오픈 웨이트 모델들은 선두 모델 대비 50%포인트 이상 낮은 성능을 기록했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @ArtificialAnlys: Today we’re launching our leaderboard for Terminal-Bench-Science 0.1, an agentic benchmark for scientific research work. GPT-6 Ast

원문 보기 ↗

광고

다음 뉴스 →

속보[속보] 미 법원, Claude 군사 기능 거부한 Anthropic 블랙리스트 지정 승인

AI 기능 제한이 정부 제재 사유가 될 수 있다는 선례. 안전장치와 군·정부 요구 충돌 주시.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스