← promppy_ 실시간 AI 뉴스
참고X

GPT-6 Astra vs Fable 5.1: ARC-AGI 벤치마크 기반 실무 성능 비교 및 테스트 방법

AI 에이전트의 화면 제어 및 작업 수행 능력을 직접 테스트하는 설정법 공유. 모델 간 성능 차이 체감 가능.

요약

최근 엑스(X) 사용자 @charliejhills가 진행한 테스트에서 GPT-6 Astra와 Claude Fable 5.1의 성능 차이가 캔바(Canva) 제어 환경에서 확연히 드러났다. 특히 AI 모델의 추론 능력을 평가하는 ARC-AGI 3 테스트에서 GPT-6 Astra는 사람이 수행하는 것보다 더 적은 동작으로 문제를 해결하며 96%의 성공률을 기록했다. 반면 Claude Opus 5는 같은 테스트에서 절반 이하의 성과를 보여 모델 간의 격차가 큼을 입증했다. 사용자는 챗GPT 데스크톱 앱의 'Computer Use' 기능을 활성화하고 권한을 부여하는 것만으로 직접 해당 기능을 체험할 수 있다. 이번 결과는 범용인공지능(AGI) 구현 가능성에 대한 업계의 기대감을 다시 한번 고조시키고 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @charliejhills: Someone gave GPT-6 and Fable 5.1 access to Canva. One smoked the other (it's not even close). Claude Fable 5.1 is on the left. GPT

원문 보기 ↗

광고

다음 뉴스 →

중요앤트로픽 "Claude가 358년 수학 난제 증명…역대 최장 증명 작성"

장문·복잡 추론 벤치마크 재평가 신호. 검증·재현 여부 확인 후 실무 적용 판단 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스