← promppy_ 실시간 AI 뉴스
중요Reddit

GPT-6 Astra vs Fable 5.1 실측: 에이전트 성능은 진짜, ARC-AGI 하네스 민감도는 골칫거리

단일 추론 과제엔 비용 대비 애매하나 다단계 실행(Terminal-Bench·OSWorld)이면 도입 검토 가치 큼.

요약

Reddit 사용자들의 테스트 결과에 따르면, GPT-6 Astra는 단순 추론이나 단일 턴 작업에서는 이전 모델인 GPT-5.6 Sol이나 Claude Fable 5.1 대비 큰 성능 향상을 체감하기 어렵다. 그러나 DeepSWE v1.1(74.1%)과 GPQA Diamond(96%)에서 소폭의 성과 개선을 보인 것과 달리, 다단계 실행 영역에서는 압도적인 격차를 보여준다. 특히 Terminal-Bench 4.0에서 Astra는 57.9%의 성공률을 기록해 Sol의 37.3%보다 월등한 성능을 나타냈다. OSWorld 2.0 테스트에서도 72.6%의 성공률을 달성했으며, 작업 소요 시간을 기존 1시간 이상에서 40분대로 대폭 단축했다. 결과적으로 GPT-6 Astra는 데이터베이스 마이그레이션과 같은 복잡한 대화형 멀티스텝 작업 실행에 최적화된 아키텍처를 갖춘 것으로 평가된다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I finally ran the GPT-6 Astra evals vs Fable 5.1. The agentic gains are real, but the ARC-AGI harness sensitivity is a nightmare.

원문 보기 ↗

광고

다음 뉴스 →

중요美 FTC, OpenAI·Anthropic 등 주요 AI 기업 안전 관리 실태 조사 착수

AI 규제 강화 신호. 에이전트 배포·보안 정책 사전 점검이 리스크 관리에 유리.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스