GPT-6 Astra vs Fable 5.1: ARC-AGI 벤치마크 기반 실무 성능 비교 및 테스트 방법
AI 에이전트의 화면 제어 및 작업 수행 능력을 직접 테스트하는 설정법 공유. 모델 간 성능 차이 체감 가능.
요약
최근 엑스(X) 사용자 @charliejhills가 진행한 테스트에서 GPT-6 Astra와 Claude Fable 5.1의 성능 차이가 캔바(Canva) 제어 환경에서 확연히 드러났다. 특히 AI 모델의 추론 능력을 평가하는 ARC-AGI 3 테스트에서 GPT-6 Astra는 사람이 수행하는 것보다 더 적은 동작으로 문제를 해결하며 96%의 성공률을 기록했다. 반면 Claude Opus 5는 같은 테스트에서 절반 이하의 성과를 보여 모델 간의 격차가 큼을 입증했다. 사용자는 챗GPT 데스크톱 앱의 'Computer Use' 기능을 활성화하고 권한을 부여하는 것만으로 직접 해당 기능을 체험할 수 있다. 이번 결과는 범용인공지능(AGI) 구현 가능성에 대한 업계의 기대감을 다시 한번 고조시키고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @charliejhills: Someone gave GPT-6 and Fable 5.1 access to Canva. One smoked the other (it's not even close). Claude Fable 5.1 is on the left. GPT
원문 보기 ↗