참고팁X
GPT-5.6 Sol, ARC-AGI-3 성능 저하 원인 규명…API 설정 조정으로 점수 3배 향상
컨텍스트 관리 효율화가 벤치마크 성능에 직결됨. 토큰 효율과 추론 성능을 동시에 잡는 API 설정 최적화 필요.
요약
최근 수학계의 난제를 해결하며 주목받은 GPT-5.6 Sol 모델이 2D 퍼즐 벤치마크인 ARC-AGI-3에서는 기대 이하의 성과를 보였습니다. OpenAI 조사 결과, 이는 모델이 학습한 내용을 유지하지 못하는 설정 문제 때문인 것으로 밝혀졌습니다. 구체적으로는 테스트 환경(harness) 내에서 모델의 기억 활용을 제한하는 설정이 문제의 원인이었습니다. 해당 API 설정 두 가지를 수정하자, 모델의 ARC-AGI-3 점수는 기존 대비 3배 상승했습니다. 또한, 이 과정에서 출력 토큰 사용량은 오히려 6배 감소하는 효율 개선 효과를 얻었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @OpenAI: GPT-5.6 Sol has been used to solve open problems in mathematics. So why was it struggling with ARC-AGI-3, a benchmark of 2D puzzle
원문 보기 ↗