← promppy_ 실시간 AI 뉴스
참고X

코딩 벤치마크 'FrontierSWE v2' 공개, Claude Fable 5.1 성능 우위

초장기 호라이즌 코딩 작업에 특화된 벤치마크입니다. 현업 모델 선택 시 참고할 성능 지표로 활용 가능합니다.

요약

ProximalHQ가 초장기 호라이즌 코딩 벤치마크인 FrontierSWE v2를 새롭게 출시했다. 이번 v2 버전은 기존보다 확장된 작업 스위트와 개선된 평가 방법론을 적용한 것이 특징이다. 벤치마크 결과, 최첨단 AI 모델들 사이에서 상당한 성능 격차가 나타나는 것으로 확인됐다. 특히 Claude Fable 5.1 모델이 다른 모델들을 큰 격차로 따돌리고 선두를 차지했다. 이번 업데이트는 복잡하고 긴 코딩 작업을 수행하는 모델의 능력을 보다 정교하게 측정할 수 있을 것으로 기대된다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @ProximalHQ: We are releasing FrontierSWE v2, our updated ultra-long horizon coding benchmark V2 features an expanded task suite and improved m

원문 보기 ↗
다음 뉴스 →

중요OpenAI Astra, '불투명 재귀' 추론 도입…AI 안전 전문가 경계령

CoT 모니터링이 어려워지는 방식. 안전성·설명가능성 요구 서비스는 채택 전 검증 강화 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스