참고X
OpenAI GPT-6 Astra 주요 벤치마크 결과 공개
FrontierMath, DeepSWE 등 주요 지표에서 고성능 확인. 신규 모델 평가 시 활용.
요약
최근 공개된 GPT-6 Astra 모델의 주요 벤치마크 점수가 화제가 되고 있다. 해당 모델은 FrontierMath Tier 4 v2에서 97.6%, BenchCAD에서 95.9%의 성능을 기록했다. 또한 GPQA Diamond는 96%, ExploitBench는 100%를 달성했으며, ARC-AGI-3 벤치마크에서는 98.6%라는 높은 수치를 나타냈다. 코드 생성 및 해결 능력 평가인 DeepSWE v1.1에서는 74.1%의 정확도를 보였다. 오픈AI는 이 모델을 향후 수일 내에 유료 챗GPT 구독자와 API 사용자를 대상으로 제공할 계획이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: GPT-6 Astra Benchmarks: FrontierMath Tier 4 v2: 97.6% DeepSWE v1.1: 74.1% BenchCAD: 95.9% GPQA Diamond: 96% ExploitBench: 100% ARC
원문 보기 ↗