AI 에이전트의 과학 연구 역량 평가 벤치마크 'Terminal-Bench-Science' 공개
과학 연구 워크플로우 수행 능력을 측정하는 새로운 벤치마크. 에이전트 연구 및 개발 시 참고 자료로 활용 가능.
요약
스탠퍼드 대학교 연구진이 주도하여 개발한 Terminal-Bench-Science는 과학적 연구 워크플로우를 통해 AI 에이전트의 능력을 평가하는 새로운 벤치마크입니다. AI 모델 개발자가 아닌 실제 과학자들이 직접 구축한 이 벤치마크는 생명, 물리, 지구, 수학, 공학 등 다양한 과학 분야의 70개 과제로 구성되어 있습니다. 현재 가장 성능이 뛰어난 Claude Opus 5 모델조차 0.1 버전에서 30%의 해결률을 기록하는 등 높은 난이도를 보이고 있습니다. 이 프로젝트는 단순한 평가를 넘어 AI 에이전트가 복잡하고 반복적인 연구 업무를 수행하도록 함으로써 과학자들이 창의적인 판단에 집중할 수 있는 환경을 조성하는 것을 목표로 합니다. 지속적으로 업데이트되는 이 벤치마크는 과학적 요구사항과 AI 기술 발전 사이의 선순환 구조를 구축하는 역할을 할 것입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Terminal-Bench-Science: Evaluating AI agents on scientific research workflows
원문 보기 ↗