← promppy_ 실시간 AI 뉴스
참고X

Terminal-Bench 4.0 결과: Claude Fable 5.1 1위, Grok 4.7 성능 추격

Claude Fable 5.1이 57.9%로 선두, Grok 4.7은 38.0%로 GPT-5.6 Sol을 추월하며 벤치마크 성능 격차 확인.

요약

SpaceXAI가 Grok 4.7의 모델 카드를 공개하며 최신 벤치마크 결과가 발표되었습니다. Terminal-Bench 4.0 평가 결과, Claude Fable 5.1이 57.9%의 성능을 기록하며 압도적인 1위를 차지했습니다. Grok 4.7은 이전 대비 20.3%에서 38.0%로 성능이 대폭 향상되었습니다. 이로써 Grok 4.7은 GPT-5.6 Sol을 제치고 순위 상승을 기록했습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @ns123abc: SpaceXAI dropped Grok 4.7 model card. Look at who dominates Terminal-Bench 4.0: Claude Fable 5.1 is mogging everyone at 57.9% Grok

원문 보기 ↗

광고

다음 뉴스 →

중요아마존, 메타 'Muse' AI 에이전트 쇼핑몰 접근 차단

에이전트가 API 없는 사이트에 브라우저로 접근하는 방식은 약관 위반 리스크. 커머스 연동 기획 시 사전 승인 필수.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스