Artificial Analysis, 'Capability Indices v1.1' 공개: 직무별 모델 성능 평가 강화
재무·법률·엔지니어링 등 6개 직무 벤치마크 업데이트. 실무 워크로드별 모델 선정 근거로 참고 가치.
요약
Artificial Analysis는 핵심 지능 지수 v4.3과 전문화된 평가를 결합한 'Capability Indices v1.1'을 발표하며 도메인 튜닝을 강화했다. 이번 업데이트로 금융·회계, 전략·운영, 법률, 의료, 엔지니어링, 경제 등 6개 분야 인덱스에 Agentic Tool Use와 AA-Briefcase 등이 추가되었으며, Agentic Customer Interaction은 제외되었다. 평가 결과, Claude Fable 5.1(max)이 6개 인덱스 모두에서 1위를 차지했으며 GPT-6 Astra(max)가 그 뒤를 이었다. 오픈 웨이트 모델들 또한 경쟁력을 보였는데, Kimi K3(max)는 금융·회계, 법률, 경제 분야에서 상위권에 올랐다. 또한 DeepSeek V4.1 Flash(max)와 GLM-5.3(max)도 전략·운영, 의료, 엔지니어링 분야에서 각각 선두권을 기록하며 주요 오픈 모델의 입지를 다졌다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ArtificialAnlys: Announcing Artificial Analysis Capability Indices v1.1, updated with stronger domain tuning, combining slices of core Intelligence
원문 보기 ↗