참고Reddit
ARC-AGI 3 벤치마크, 에이전트 능력 과소평가 논란
벤치마크가 에이전트의 컨텍스트 유지 능력을 제한하여 실제 성능을 제대로 측정하지 못한다는 분석입니다.
요약
ARC-AGI 3 평가 방식이 AI의 실제 지능을 공정하게 측정하지 못한다는 비판이 제기되었습니다. 기존 방식은 추론 에이전트가 행동 간 문맥을 유지하지 못하게 설계되어, 모델이 이전에 도출한 정보를 반복적으로 망각하게 만들었습니다. 반면 OpenAI가 실제 현업 에이전트처럼 추론 과정과 이전 문맥을 압축하여 보존하도록 허용하자, 모델의 ARC-AGI 3 점수는 토큰 사용량을 대폭 줄이면서도 약 3배가량 상승했습니다. 인간이 학습한 내용을 기록하고 보존하듯, 실제 세계의 에이전트 역시 정보 압축 및 기억 유지가 필수적인 기능입니다. 따라서 단순히 매 행동마다 기억을 삭제하는 방식의 평가는 시스템의 진정한 능력을 반영할 수 없다는 지적입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 ARC-AGI 3 is not an honest measure of AGI
원문 보기 ↗