중요X
MirrorCode 벤치마크 업데이트: Claude Fable 5, GPT-5.6 Sol 압도
코딩 벤치마크서 64% 대 20%로 격차 뚜렷. 코딩 에이전트 모델 선정 시 재검토 가치.
요약
Epoch AI Research가 MirrorCode 리더보드를 업데이트하며 최신 AI 모델인 Claude Fable 5와 GPT-5.6 Sol의 성능 결과를 공개했다. 평가 결과 Claude Fable 5가 64%의 문제 해결률(solve rate)을 기록하며 1위를 차지했다. GPT-5.6 Sol은 20%의 해결률을 보이며 뒤를 이었다. 이번 업데이트는 최신 언어 모델들의 코딩 및 문제 해결 능력을 비교할 수 있는 최신 지표를 제공한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @EpochAIResearch: We've updated the MirrorCode leaderboard with results for Claude Fable 5 and GPT-5.6 Sol. Claude Fable 5 leads with a 64% solve ra
원문 보기 ↗