← promppy_ 실시간 AI 뉴스
참고X

GPT-5.6 Sol의 ARC-AGI-3 벤치마크 저평가 논란…OpenAI의 해명

벤치마크 하네스(harness) 환경이 특정 모델에 불리할 수 있음을 보여주는 사례. 벤치마크 결과 해석 시 컨텍스트 처리 방식을 고려해야 함.

요약

ARC-AGI-3 벤치마크 공식 리더보드상 Opus 5는 30.2%, GPT-5.6 Sol은 7.8%의 점수를 기록하며 여전히 Opus 5가 우위를 점하고 있다. 그러나 OpenAI는 기존 벤치마크 테스트 환경이 Sol의 추론 능력과 기억 유지에 불리하게 작용한다고 주장했다. 실제로 OpenAI가 자체적으로 개발한 'Compaction' 기술을 활용해 추론 내용을 보존하고 과거 정보를 압축하여 테스트한 결과, Sol의 점수는 13.3%에서 38.3%로 크게 상승했다. 이는 단순히 모델 자체의 성능뿐만 아니라 기억 관리, 문맥 유지, 테스트 환경(harness)이 벤치마크 결과에 결정적인 영향을 미친다는 것을 시사한다. 현재까지는 공식적인 비교 데이터가 부족하여 Sol이 Opus 5를 완전히 앞섰다고 단정하기는 어렵다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @kimmonismus: Is GPT‑5.6 Sol now better than Opus 5 on ARC‑AGI‑3? Short answer: not on the official leaderboard, but the comparison is more comp

원문 보기 ↗
다음 뉴스 →

중요OpenAI, 오늘 Codex 신규 릴리스 예고 — "측정할 필요 없이 저렴한 지능"

실현 시 코드 생성 비용 구조 급변 가능. 발표 후 실제 가격·성능 확인 후 도입 검토 권장.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

다른 매체 보도

관련 뉴스

최신 뉴스