프랑수아 숄레: ARC-AGI-3 벤치마크 6개월 만에 정복
에이전트 능력이 예상보다 빠르게 발전하며 벤치마크가 가리키는 기술적 궤적을 숄레가 분석.
요약
François Chollet는 지난 3월 ARC-AGI-3 벤치마크 공개 당시 최신 모델들의 점수가 1% 미만으로 기록되자 일부 커뮤니티로부터 벤치마크 오류라는 비판을 받았다고 언급했다. 그러나 그는 해당 벤치마크가 인간이 평균보다 높은 역량을 보이면 100% 점수를 달성할 수 있도록 잘 설계되었으며, 에이전트형 일반 지능(agentic general intelligence)이 발전함에 따라 AI 역시 100% 도달이 충분히 가능하다고 설명했다. 실제로 최근 6개월 만에 AI의 ARC-AGI-3 점수가 1% 미만에서 100%까지 상승했다. 이러한 벤치마크의 급격한 변화는 에이전트형 AI 역량이 예상보다 빠르게 성장하고 있음을 증명한다. 결론적으로 ARC-AGI-3는 최근 AI의 실질적인 능력 변화를 효과적으로 포착하고 있음을 보여준다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @fchollet: Side note: when we released ARC-AGI-3 in March, and frontier models scored <1% on it, a few Singularitarian poasters took it as a
원문 보기 ↗