← promppy_ 실시간 AI 뉴스
참고X

정량 분석 에이전트 벤치마크 'AA-AnalystAgent' 공개

실무 분석 업무에서 에이전트의 일관성과 판단력을 측정하는 신규 벤치마크. 에이전트 워크플로우 검증 시 pass^5 지표 참고.

요약

Artificial Analysis는 실제 스프레드시트와 문서를 분석하는 에이전트 성능을 평가하는 신규 벤치마크 'AA-AnalystAgent'를 공개했다. 14개 비즈니스 및 과학 분야의 80개 문항으로 구성된 이 벤치마크는 모델의 정량적 능력뿐만 아니라 전문적인 판단력과 일관성을 평가하며, 5회 반복 시도하여 모두 성공해야 통과하는 'pass^5(pass-all-5)'를 핵심 지표로 삼는다. 평가 결과 Claude Opus 5가 54%로 1위를 차지했으며, GPT-5.5(50%)와 Claude Fable 5(49%)가 그 뒤를 이었다. 특히 최고 성능 모델들 간의 격차는 단순 능력보다 신뢰성에서 발생했는데, GPT-5.5는 평균 성공률인 pass@1에서 우위를 보였으나 Claude Opus 5는 반복 일관성 지표인 pass^5에서 더 높은 성과를 냈다. 모델들의 주요 실패 원인으로는 초기 분석 단계에서 잘못된 해석을 고수하는 사례가 전체 실패의 57%를 차지하는 것으로 나타났다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @ArtificialAnlys: Announcing AA-AnalystAgent, our new agentic benchmark for quantitative analysis on real-world spreadsheets & documents. Claude Opu

원문 보기 ↗
다음 뉴스 →

중요Mistral, 오픈 모델 호스팅·지역 엔드포인트 출시…AI 플랫폼 사업자로 도약

연산 지역을 유럽·미국 중 선택 가능. 데이터 주권·규제 대응 필요한 서비스면 API 검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스