참고팁X
GPT-6.1 Sol 벤치마크 결과, 평가 환경에 따른 성능 편차 확인
Codex와 mini-swe 등 평가 프레임워크에 따라 모델 성능 지표가 다르게 나타날 수 있음을 시사합니다.
원문 제목 @theo: Updated run just finished. GPT-6.1 Sol still crushes. Turns out it performs WAY better in Codex than in mini-swe (what Artificial
원문 보기 ↗