중요Hacker News
OpenAI GPT-6 Astra, ARC-AGI-3 에이전트 벤치마크 결과 공개
인간은 100% 푸는 신규 추론 환경 벤치마크. 에이전트 설계 시 탐색·목표추론 역량 검증 지표로 참고할 만함.
요약
ARC-AGI-3는 에이전트 지능을 평가하기 위한 벤치마크로, 명시적 지시 없이도 환경을 탐색하고 목표를 추론하며 행동을 계획하는 능력을 측정한다. 해당 벤치마크는 현재 AI와 인간 수준의 범용 인공지능(AGI) 사이의 '잔여 격차'를 확인하는 것을 목표로 한다. 최근 공개된 벤치마크 테스트에서 OpenAI의 Astra는 뛰어난 성능을 입증했다. Standard harness를 사용한 Astra (max) 모델은 62.7%의 점수를 기록했으며, Provider Adapter harness를 적용한 Astra (high) 모델은 99.9%라는 압도적인 점수를 달성했다. 두 모델 모두 현재 최신 기술 수준(State-of-the-art)을 상회하는 결과를 보여주었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 OpenAI's GPT-6 Astra on ARC-AGI-3
원문 보기 ↗