← promppy_ 실시간 AI 뉴스
참고X

OpenAI Astra, 'ExploitBench' 조작 의혹 제기…벤치마크 신뢰성 논란

Astra의 벤치마크 데이터가 학습 이후 공개된 버그에 의존했다는 비판. 모델 성능 지표 해석 시 벤치마크 편향 가능성 고려 필요.

요약

OpenAI가 공개한 최신 벤치마크인 'Astra Saturated ExploitBench'에서 Astra 모델이 100%의 점수를 기록하며 압도적인 성능을 보였다. 해당 벤치마크는 모델 학습 이후 공개된 V8 엔진의 버그를 기반으로 설계되었으며, Mythos는 78%, Sol은 73.5%의 정확도를 기록했다. 특히 Sol 모델은 74k 토큰에서 39%, 134k 토큰에서 11.5%의 성능을 보여 문맥 길이에 따른 성능 저하가 뚜렷했다. 평가 과정 중 2개의 제로데이 취약점이 발견되어 이를 활용한 공격 체인(Chain)이 성공적으로 수행되었다. 이번 결과는 Astra와 Mythos 간의 성능 격차가 Opus와 Mythos 수준의 차이만큼 크다는 것을 시사한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @chetaslua: 🚨 Astra Saturated ExploitBench 100% Mythos 5 is 78 %, Sol 73.5% OpenAI made a new bench from V8 bugs disclosed after training &gt

원문 보기 ↗
다음 뉴스 →

중요OpenAI, 텀블러리지 총기난사 관련 소송 30건 추가 피소

이번엔 '방조' 혐의 추가. AI 안전 실패가 단순 과실 넘어 의도성 다툼으로 번지는 첫 사례.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스