← promppy_ 실시간 AI 뉴스
중요X

Artificial Analysis, 인텔리전스 인덱스 v4.3 공개…에이전트 벤치마크 강화

Terminal-Bench 4.0·Zapier 기반 AutomationBench 추가. 모델 선정 시 에이전트 벤치 재확인 필요.

요약

Artificial Analysis가 Intelligence Index v4.3을 발표하며 Terminal-Bench 4.0 업데이트 및 AutomationBench-AA 도입을 통해 에이전트 성능 평가 기준을 강화했습니다. Terminal-Bench 4.0은 66개의 다단계 작업을 통해 소프트웨어 엔지니어링, 머신러닝 등의 에이전트 수행 능력을 검증하며, 기존 Terminus 2 대신 mini-SWE-agent를 사용하여 평가의 정교함을 높였습니다. Zapier와 협력해 새롭게 도입된 AutomationBench-AA는 Gmail, Slack, Jira 등 657개의 비즈니스 워크플로우를 테스트하며, 비공개 테스트셋 비중을 40%에서 45%로 상향해 모델의 평가 왜곡을 방지합니다. 이번 개편 결과, Claude Fable 5.1(max with fallback)과 GPT-6 Astra(max)가 각각 53점을 기록하며 인텔리전스 인덱스 선두를 차지했습니다. 에이전트 능력 평가의 비중은 30%, 코딩 20%, 일반 30%, 과학적 추론 20%로 기존 가중치를 유지합니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @ArtificialAnlys: Announcing Artificial Analysis Intelligence Index v4.3, upgrading Terminal-Bench to 4.0 and adding AutomationBench-AA, an agentic

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI, Plus·Business 표준 요금제에 5시간 사용량 제한 재도입

구독 요금제 사용량 한도 부활. ChatGPT 헤비 유저라면 모델 전환 대안 확보 검토 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

최신 뉴스