참고Reddit
ARC-AGI-3 벤치마크 급변: 로컬 모델, 인간 수준 상회 시작
소형 로컬 모델들이 벤치마크에서 인간의 평균 성능을 추월하는 추세 확인. 추론 모델 성능 평가 시 참고.
요약
Kaggle의 ARC-AGI-3 벤치마크 리더보드에서 상위 점수가 기존 7%에서 56%로 급격히 상승했습니다. 이는 최근 30일 동안 발생한 변화로, 로컬 환경에서 구동 가능한 소규모 모델들이 하네스(harness)를 통해 달성한 성과입니다. ARC-AGI-3는 인간의 지능적 우위를 입증하기 위해 설계된 벤치마크임에도 불구하고, 이제 소규모 모델들이 일반적인 인간의 평균 수준을 상회하는 성능을 보이고 있습니다. 이번 결과는 대규모 모델이 아닌 제한적인 로컬 모델로도 고난도 추론 작업에서 유의미한 성능 향상이 가능함을 시사합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Top ARC-ΑGI-3 scores on Kaggle just went from 7% to 56% [N]
원문 보기 ↗