참고X
Terminal-Bench 4.0 결과: Claude Fable 5.1 1위, Grok 4.7 성능 추격
Claude Fable 5.1이 57.9%로 선두, Grok 4.7은 38.0%로 GPT-5.6 Sol을 추월하며 벤치마크 성능 격차 확인.
요약
SpaceXAI가 Grok 4.7의 모델 카드를 공개하며 최신 벤치마크 결과가 발표되었습니다. Terminal-Bench 4.0 평가 결과, Claude Fable 5.1이 57.9%의 성능을 기록하며 압도적인 1위를 차지했습니다. Grok 4.7은 이전 대비 20.3%에서 38.0%로 성능이 대폭 향상되었습니다. 이로써 Grok 4.7은 GPT-5.6 Sol을 제치고 순위 상승을 기록했습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ns123abc: SpaceXAI dropped Grok 4.7 model card. Look at who dominates Terminal-Bench 4.0: Claude Fable 5.1 is mogging everyone at 57.9% Grok
원문 보기 ↗