과학 연구 워크플로우 전용 AI 에이전트 벤치마크 'Terminal-Bench-Science' 공개
과학 및 공학 도메인에서 에이전트의 복합 작업 수행 능력을 평가하는 새로운 벤치마크. 모델 성능 비교 시 활용 가능.
요약
스탠포드 주도의 커뮤니티 프로젝트인 Terminal-Bench-Science가 과학 분야 연구 워크플로우를 평가하기 위한 AI 에이전트 벤치마크를 공개했다. 이번 v0.1 버전은 생명과학, 물리, 지구과학, 수학, 공학 등 다양한 과학 분야에 걸친 70개의 과제로 구성되어 있다. 각 과제는 실제 연구자들이 자신의 워크플로우를 직접 AI 에이전트가 해결해야 할 도전적인 과제로 변환하여 제작했다. 현재 Claude Opus 5 모델의 경우 해당 벤치마크 과제의 약 30% 정도만을 해결하는 수준을 보이고 있다. 본 프로젝트는 전 세계 연구 기관의 과학 전문가들이 협력하여 지속적으로 개발 중이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @StevenDillmann: We're releasing Terminal-Bench-Science: a benchmark for evaluating AI agents on research workflows across scientific domains. An o
원문 보기 ↗