참고X
DeepSWE 벤치마크 74% 기록한 신규 스텔스 모델 화제
GPT-5.6 Sol을 상회하는 벤치마크 결과로 화제가 된 미공개 모델. 중국발 모델로 추정되며, 성능 효율성 면에서 주목.
요약
최근 한 익명의 '스텔스 모델'이 벤치마크 테스트에서 놀라운 성능을 기록하며 업계의 주목을 받고 있다. 해당 모델은 DeepSWE 벤치마크에서 74%의 점수를 기록하며 GPT-5.6 Sol을 포함한 기존 모델들을 제쳤다. 또한 Terminal-Bench 2.1 및 SWE-Bench Verified에서도 GPT-5.6 Sol보다 뛰어난 성능을 보인 것으로 보고되었다. 특히 이 모델은 성능 우위뿐만 아니라 더 저렴한 비용으로 운영 가능하다는 점이 특징이다. 일각에서는 이번 모델이 중국 기업에서 개발했을 가능성을 제기하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: Here we go again: a new stealth model scores 74% on DeepSWE, beating GPT-5.6 Sol and most other models. It also reportedly outperf
원문 보기 ↗