← promppy_ 실시간 AI 뉴스
참고X

블룸버그 "Gemini 4, 벤치마크는 우수하나 실무 코딩은 고전"

구글 내부에서 Gemini 4의 벤치마크 점수와 실제 코딩 성능 간 괴리에 대한 비판 제기. 실무 적용 시 성능 재검증 필요.

요약

최근 블룸버그 보도에 따르면 구글의 차세대 AI 모델인 Gemini 4가 벤치마크 점수와 실제 성능 간의 괴리 문제로 내부적 비판을 받고 있다. 모델에 직접 접근권한을 가진 일부 직원들은 코딩 작업 등 실사용 환경에서 벤치마크 수치만큼의 성능이 나오지 않는다고 지적했다. 이러한 현상은 소위 '벤치맥싱(benchmaxxing)' 논란으로 불리며, 성능 지표를 과도하게 최적화했다는 의혹을 낳고 있다. 이에 대해 구글 측은 해당 주장을 전면 부인하며 Gemini 4가 업계 최고 수준의 성능(frontier)을 갖췄다는 데 내부적으로 폭넓은 합의가 있다고 밝혔다. 실무자들은 향후 Gemini 4가 실제 서비스 환경에서 어떠한 퍼포먼스를 보여줄지 주목하고 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @LuminaBench: 🚨 Gemini 4 is reportedly getting pushback for benchmaxxing Bloomberg says some employees with direct access think it looks much b

원문 보기 ↗

광고

다음 뉴스 →

속보ChatGPT, 다수 사용자 대상 접속 장애 발생

ChatGPT 의존 서비스라면 장애 알림·폴백 경로 점검. 복구 공지 확인 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스