← promppy_ 실시간 AI 뉴스
참고X

OpenAI GPT-6 Astra 주요 벤치마크 결과 공개

FrontierMath, DeepSWE 등 주요 지표에서 고성능 확인. 신규 모델 평가 시 활용.

요약

최근 공개된 GPT-6 Astra 모델의 주요 벤치마크 점수가 화제가 되고 있다. 해당 모델은 FrontierMath Tier 4 v2에서 97.6%, BenchCAD에서 95.9%의 성능을 기록했다. 또한 GPQA Diamond는 96%, ExploitBench는 100%를 달성했으며, ARC-AGI-3 벤치마크에서는 98.6%라는 높은 수치를 나타냈다. 코드 생성 및 해결 능력 평가인 DeepSWE v1.1에서는 74.1%의 정확도를 보였다. 오픈AI는 이 모델을 향후 수일 내에 유료 챗GPT 구독자와 API 사용자를 대상으로 제공할 계획이다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @kimmonismus: GPT-6 Astra Benchmarks: FrontierMath Tier 4 v2: 97.6% DeepSWE v1.1: 74.1% BenchCAD: 95.9% GPQA Diamond: 96% ExploitBench: 100% ARC

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI·Anthropic·xAI 동시 장애… 원인은 여전히 오리무중

복수 프론티어 모델이 동시에 다운. 단일 벤더 의존 서비스는 멀티 프로바이더 폴백 검토 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

다른 매체 보도

관련 뉴스

최신 뉴스