← promppy_ 실시간 AI 뉴스
참고X

Gemini 3.8·Muse 1.3, 벤치마크 과적합 의혹

공개 벤치마크에 최적화되어 실제 성능이 저조하다는 분석, 모델 평가 시 주의.

요약

Gemini 3.8 Flash와 Muse Spark 1.3은 최근 모델 중 벤치마크 점수를 의도적으로 높인 '벤치맥스(benchmaxxed)' 성향이 가장 뚜렷하게 나타나는 모델로 평가받는다. 해당 모델들은 Terminal Bench 2.1에서는 GPT-6 및 Fable 5.1과 유사한 성능을 보이지만, Terminal Bench 4.0에서는 성능이 현저히 떨어진다. 이는 Terminal Bench 2.1의 작업 데이터가 공개되어 있어 기업들이 해당 데이터를 모방한 학습 데이터를 RL 환경 스타트업으로부터 구매해 학습에 활용했기 때문으로 분석된다. 결과적으로 벤치마크 점수 개선이 실제 에이전트 작업 수행 능력 향상으로 일반화되지 못하고 있음을 보여준다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @SemiAnalysis_: Gemini 3.8 Flash and Muse Spark 1.3 are two of the most clearly benchmaxxed models we've seen yet. Despite being comparable to bot

원문 보기 ↗

광고

다음 뉴스 →

중요삼성SDS, '다차원 AI 풀스택' 전략 발표…AI 보안·피지컬 AI로 확장

엔터프라이즈 AX 도입-성과 간극 해소가 핵심 화두. 국내 대기업 AI 전략 벤치마킹 참고.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스