Artificial Analysis, 인텔리전스 인덱스 v4.1.1 업데이트…평가 모델 GPT-5.6 Luna로 변경
벤치마크 평가 방법론 변화 확인 필요. 주요 모델들의 정량적 지표 업데이트 및 등급 체계 최신화.
요약
Artificial Analysis는 Intelligence Index를 v4.1.1로 업데이트하며 평가 모델과 𝜏³-Banking 평가 방식을 개선했다. 이번 패치로 HLE, AA-LCR, AA-Omniscience 평가 모델이 GPT-4o, Qwen3 235B A22B 2507, Gemini 3 Flash Preview에서 GPT-5.6 Luna(medium)로 통합 교체되었다. 또한 𝜏³-Banking은 Sierra Platform의 v1.0.1을 적용하여 궤적 복구 및 정확성 오류를 해결했다. 이번 업데이트에 따른 점수 변화는 대부분 1점 미만으로 크지 않으며, 기존 모델 순위도 대체로 유지되었다. Muse Spark 1.2(xhigh)가 2.7점으로 가장 큰 점수 상승을 보였으며, Claude Opus 5는 Index 63점으로 1위 자리를 지켰다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ArtificialAnlys: We have updated the Artificial Analysis Intelligence Index to v4.1.1 - this patch release upgrades our grader models, and brings t
원문 보기 ↗