Gemini 4 Argon, 인텔리전스 인덱스 및 오토메이션 벤치마크서 1위 기록
환각 현상을 15%로 대폭 낮추고 AutomationBench에서 1위를 기록하는 등 실질 성능이 개선되었습니다.
요약
구글의 최신 모델 Gemini 4 Argon이 Artificial Analysis(AA)의 인텔리전스 인덱스에서 53점을 기록하며 GPT-6 Astra와 동등한 수준의 성능을 입증했다. 특히 Gemini 4 Argon은 AutomationBench-AA에서 1위를 차지하며 자동화 작업에서의 강력한 역량을 보여주었다. AA-Omniscience 벤치마크 결과, Argon의 환각 비율은 15%로 Astra의 51% 대비 현저히 낮아 신뢰성이 개선된 것으로 나타났다. 다만, 응답 정확도는 50%로 Astra의 63%보다 다소 낮으나 불확실한 질문에 대해 솔직하게 모른다고 답하는 경향을 보였다. 이번 결과는 Gemini 4 Argon이 높은 신뢰도와 자동화 성능을 갖춘 경쟁력 있는 모델임을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: Even on AAI index Gemini 4 looks really really good! Fable-Class Model. Gemini 4 Argon matches GPT-6 Astra on Artificial Analysis’
원문 보기 ↗