← promppy_ 실시간 AI 뉴스
참고Hacker News

AI 에이전트의 과학 연구 역량 평가 벤치마크 'Terminal-Bench-Science' 공개

과학 연구 워크플로우 수행 능력을 측정하는 새로운 벤치마크. 에이전트 연구 및 개발 시 참고 자료로 활용 가능.

요약

스탠퍼드 대학교 연구진이 주도하여 개발한 Terminal-Bench-Science는 과학적 연구 워크플로우를 통해 AI 에이전트의 능력을 평가하는 새로운 벤치마크입니다. AI 모델 개발자가 아닌 실제 과학자들이 직접 구축한 이 벤치마크는 생명, 물리, 지구, 수학, 공학 등 다양한 과학 분야의 70개 과제로 구성되어 있습니다. 현재 가장 성능이 뛰어난 Claude Opus 5 모델조차 0.1 버전에서 30%의 해결률을 기록하는 등 높은 난이도를 보이고 있습니다. 이 프로젝트는 단순한 평가를 넘어 AI 에이전트가 복잡하고 반복적인 연구 업무를 수행하도록 함으로써 과학자들이 창의적인 판단에 집중할 수 있는 환경을 조성하는 것을 목표로 합니다. 지속적으로 업데이트되는 이 벤치마크는 과학적 요구사항과 AI 기술 발전 사이의 선순환 구조를 구축하는 역할을 할 것입니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

원문 보기 ↗
다음 뉴스 →

중요소프트뱅크, 가정용 휴머노이드 기업 '1X' 과반 지분 인수 추진

손정의의 피지컬 AI 베팅 본격화. 가정용 로봇 시장의 자본 흐름과 밸류에이션 주목.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스