참고X
코딩 벤치마크 'FrontierSWE v2' 공개, Claude Fable 5.1 성능 우위
초장기 호라이즌 코딩 작업에 특화된 벤치마크입니다. 현업 모델 선택 시 참고할 성능 지표로 활용 가능합니다.
요약
ProximalHQ가 초장기 호라이즌 코딩 벤치마크인 FrontierSWE v2를 새롭게 출시했다. 이번 v2 버전은 기존보다 확장된 작업 스위트와 개선된 평가 방법론을 적용한 것이 특징이다. 벤치마크 결과, 최첨단 AI 모델들 사이에서 상당한 성능 격차가 나타나는 것으로 확인됐다. 특히 Claude Fable 5.1 모델이 다른 모델들을 큰 격차로 따돌리고 선두를 차지했다. 이번 업데이트는 복잡하고 긴 코딩 작업을 수행하는 모델의 능력을 보다 정교하게 측정할 수 있을 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ProximalHQ: We are releasing FrontierSWE v2, our updated ultra-long horizon coding benchmark V2 features an expanded task suite and improved m
원문 보기 ↗