참고X
GPT-6 Astra, SimpleBench 86.5% 기록…Claude Fable 5.1과 대등
추론 및 복잡한 상황 대처 능력을 평가하는 SimpleBench에서 최상위권 달성. 모델 성능 비교 시 참고.
요약
최근 공개된 SimpleBench 평가에서 GPT-6 Astra가 86.5%의 점수를 기록하며 주요 모델들과 경쟁하고 있다. 이번 벤치마크에서 Claude Fable 5.1은 86.6%를 획득해 GPT-6 Astra와 거의 대등한 성적을 거뒀다. 두 모델 모두 SimpleBench의 인간 기준치인 83.7%를 상회하는 결과를 보였다. SimpleBench는 공간 논리부터 사회적 상황, 함정 질문에 이르기까지 일상적인 추론 능력을 평가한다. 그동안 고성능 AI 모델들이 반복적으로 어려움을 겪었던 일상적인 질문에서 AI가 유의미한 발전 성과를 나타내고 있다는 평가가 나온다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: GPT-6 Astra is now on SimpleBench. Astra Pro scores 86.5%, almost tied with Claude Fable 5.1 at 86.6%. Both beat the benchmark’s h
원문 보기 ↗