GPT-6 Astra vs Fable 5.1 실측: 에이전트 성능은 진짜, ARC-AGI 하네스 민감도는 골칫거리
단일 추론 과제엔 비용 대비 애매하나 다단계 실행(Terminal-Bench·OSWorld)이면 도입 검토 가치 큼.
요약
Reddit 사용자들의 테스트 결과에 따르면, GPT-6 Astra는 단순 추론이나 단일 턴 작업에서는 이전 모델인 GPT-5.6 Sol이나 Claude Fable 5.1 대비 큰 성능 향상을 체감하기 어렵다. 그러나 DeepSWE v1.1(74.1%)과 GPQA Diamond(96%)에서 소폭의 성과 개선을 보인 것과 달리, 다단계 실행 영역에서는 압도적인 격차를 보여준다. 특히 Terminal-Bench 4.0에서 Astra는 57.9%의 성공률을 기록해 Sol의 37.3%보다 월등한 성능을 나타냈다. OSWorld 2.0 테스트에서도 72.6%의 성공률을 달성했으며, 작업 소요 시간을 기존 1시간 이상에서 40분대로 대폭 단축했다. 결과적으로 GPT-6 Astra는 데이터베이스 마이그레이션과 같은 복잡한 대화형 멀티스텝 작업 실행에 최적화된 아키텍처를 갖춘 것으로 평가된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I finally ran the GPT-6 Astra evals vs Fable 5.1. The agentic gains are real, but the ARC-AGI harness sensitivity is a nightmare.
원문 보기 ↗