Artificial Analysis, 인텔리전스 인덱스 v4.3 공개…에이전트 벤치마크 강화
Terminal-Bench 4.0·Zapier 기반 AutomationBench 추가. 모델 선정 시 에이전트 벤치 재확인 필요.
요약
Artificial Analysis가 Intelligence Index v4.3을 발표하며 Terminal-Bench 4.0 업데이트 및 AutomationBench-AA 도입을 통해 에이전트 성능 평가 기준을 강화했습니다. Terminal-Bench 4.0은 66개의 다단계 작업을 통해 소프트웨어 엔지니어링, 머신러닝 등의 에이전트 수행 능력을 검증하며, 기존 Terminus 2 대신 mini-SWE-agent를 사용하여 평가의 정교함을 높였습니다. Zapier와 협력해 새롭게 도입된 AutomationBench-AA는 Gmail, Slack, Jira 등 657개의 비즈니스 워크플로우를 테스트하며, 비공개 테스트셋 비중을 40%에서 45%로 상향해 모델의 평가 왜곡을 방지합니다. 이번 개편 결과, Claude Fable 5.1(max with fallback)과 GPT-6 Astra(max)가 각각 53점을 기록하며 인텔리전스 인덱스 선두를 차지했습니다. 에이전트 능력 평가의 비중은 30%, 코딩 20%, 일반 30%, 과학적 추론 20%로 기존 가중치를 유지합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ArtificialAnlys: Announcing Artificial Analysis Intelligence Index v4.3, upgrading Terminal-Bench to 4.0 and adding AutomationBench-AA, an agentic
원문 보기 ↗