Grok 4.6 벤치마크 상세 분석: Claude Opus 5 대비 가격 효율성 입증
상세 벤치마크 데이터 공개. Claude Opus 5 대비 높은 비용 효율성으로 업무용 모델 검토 가치 있음.
요약
SpaceXAI의 새로운 모델 Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록하며 GPT-5.6 Sol과 동등한 수준의 지능형 모델로 자리 잡았다. 이번 모델은 Grok 4.5 대비 5점, Grok 4.3 대비 23점 상승했으며, Claude Opus 5와 Claude Fable 5에 이어 업계 최상위권의 성능을 보여준다. 특히 에이전트 성능 측면에서 GDPval-AA v2 Elo 1753을 달성했고, 𝜏³-Banking에서 50.7%, Terminal-Bench v2.1에서 88.4%의 높은 점수를 기록했다. 가격은 Grok 4.5와 동일한 100만 토큰당 입력 2달러, 출력 6달러로 유지되어 Claude Opus 5나 GPT-5.6 Sol 대비 60% 이상 저렴한 비용 효율성을 제공한다. 또한, AA-Briefcase 벤치마크에서 Claude Opus 5 모델군 대비 절반 수준의 턴 수와 토큰 사용량으로 장기적 에이전트 작업을 수행하며 뛰어난 효율성을 입증했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 SpaceXAI's Grok 4.6 Scores 61 on the Artificial Analysis Intelligence Index
원문 보기 ↗