← promppy_ 실시간 AI 뉴스
참고X

Artificial Analysis, 인텔리전스 인덱스 v4.1.1 업데이트…평가 모델 GPT-5.6 Luna로 변경

벤치마크 평가 방법론 변화 확인 필요. 주요 모델들의 정량적 지표 업데이트 및 등급 체계 최신화.

요약

Artificial Analysis는 Intelligence Index를 v4.1.1로 업데이트하며 평가 모델과 𝜏³-Banking 평가 방식을 개선했다. 이번 패치로 HLE, AA-LCR, AA-Omniscience 평가 모델이 GPT-4o, Qwen3 235B A22B 2507, Gemini 3 Flash Preview에서 GPT-5.6 Luna(medium)로 통합 교체되었다. 또한 𝜏³-Banking은 Sierra Platform의 v1.0.1을 적용하여 궤적 복구 및 정확성 오류를 해결했다. 이번 업데이트에 따른 점수 변화는 대부분 1점 미만으로 크지 않으며, 기존 모델 순위도 대체로 유지되었다. Muse Spark 1.2(xhigh)가 2.7점으로 가장 큰 점수 상승을 보였으며, Claude Opus 5는 Index 63점으로 1위 자리를 지켰다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @ArtificialAnlys: We have updated the Artificial Analysis Intelligence Index to v4.1.1 - this patch release upgrades our grader models, and brings t

원문 보기 ↗
다음 뉴스 →

중요Cursor, 스킬·MCP 서버를 묶는 오픈 표준 'Agent Plugins' 지원

에이전트마다 따로 설정하던 스킬·MCP를 하나로 번들링해 재사용 가능. 표준 채택 여부 주목.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스