Gemini 3.8·Muse 1.3, 벤치마크 과적합 의혹
공개 벤치마크에 최적화되어 실제 성능이 저조하다는 분석, 모델 평가 시 주의.
요약
Gemini 3.8 Flash와 Muse Spark 1.3은 최근 모델 중 벤치마크 점수를 의도적으로 높인 '벤치맥스(benchmaxxed)' 성향이 가장 뚜렷하게 나타나는 모델로 평가받는다. 해당 모델들은 Terminal Bench 2.1에서는 GPT-6 및 Fable 5.1과 유사한 성능을 보이지만, Terminal Bench 4.0에서는 성능이 현저히 떨어진다. 이는 Terminal Bench 2.1의 작업 데이터가 공개되어 있어 기업들이 해당 데이터를 모방한 학습 데이터를 RL 환경 스타트업으로부터 구매해 학습에 활용했기 때문으로 분석된다. 결과적으로 벤치마크 점수 개선이 실제 에이전트 작업 수행 능력 향상으로 일반화되지 못하고 있음을 보여준다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @SemiAnalysis_: Gemini 3.8 Flash and Muse Spark 1.3 are two of the most clearly benchmaxxed models we've seen yet. Despite being comparable to bot
원문 보기 ↗