← promppy_ 실시간 AI 뉴스
참고Hacker News

Grok 4.6 벤치마크 상세 분석: Claude Opus 5 대비 가격 효율성 입증

상세 벤치마크 데이터 공개. Claude Opus 5 대비 높은 비용 효율성으로 업무용 모델 검토 가치 있음.

요약

SpaceXAI의 새로운 모델 Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 기록하며 GPT-5.6 Sol과 동등한 수준의 지능형 모델로 자리 잡았다. 이번 모델은 Grok 4.5 대비 5점, Grok 4.3 대비 23점 상승했으며, Claude Opus 5와 Claude Fable 5에 이어 업계 최상위권의 성능을 보여준다. 특히 에이전트 성능 측면에서 GDPval-AA v2 Elo 1753을 달성했고, 𝜏³-Banking에서 50.7%, Terminal-Bench v2.1에서 88.4%의 높은 점수를 기록했다. 가격은 Grok 4.5와 동일한 100만 토큰당 입력 2달러, 출력 6달러로 유지되어 Claude Opus 5나 GPT-5.6 Sol 대비 60% 이상 저렴한 비용 효율성을 제공한다. 또한, AA-Briefcase 벤치마크에서 Claude Opus 5 모델군 대비 절반 수준의 턴 수와 토큰 사용량으로 장기적 에이전트 작업을 수행하며 뛰어난 효율성을 입증했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 SpaceXAI's Grok 4.6 Scores 61 on the Artificial Analysis Intelligence Index

원문 보기 ↗
다음 뉴스 →

중요DoorDash, AI 에이전트로 월 13만 건 엔지니어링 작업 자동화한 아키텍처 공개

태스크별 Firecracker microVM·게이트웨이 격리 구조. 사내 코딩 에이전트 운영 설계에 참고할 실전 청사진.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스