참고Reddit
ARC-AGI 벤치마크, LLM 없이 100% 점수 달성 사례 공개
LLM 의존 없이 추론 시스템만으로 벤치마크 최고 점수를 기록한 연구 사례. 추론의 원리와 아키텍처 연구에 영감을 줌.
요약
Orivael의 연구팀이 LLM을 전혀 사용하지 않는 실험적 추론 시스템으로 ARC-AGI-3의 ft09 태스크에서 100% 성공률을 달성했다. 이 시스템은 인식, 계획, 행동 선택 등 모든 과정에 LLM을 개입시키지 않고 원시 그리드를 직접 읽고 판단하여 동작한다. 특히 ft09 레벨에서는 인간의 평균 행동 횟수인 208회를 크게 밑도는 80회의 동작만으로 6/6 레벨을 모두 완료하는 성과를 보였다. 다만 tr87, cd82 등 다른 태스크에서는 5~25% 수준의 성공률을 기록하며 난이도별 편차를 드러냈다. 이번 사례는 LLM 없이도 특정 태스크에서 최상의 성능을 낼 수 있는 추론 구조의 가능성을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 We got 100% on ARC-3 ft09 with zero model calls. The failures are more interesting.
원문 보기 ↗