Gemini 4 Argon 주요 벤치마크 공개: Legal, Finance Agent 분야 강세
Gemini 4 Argon이 Legal Agent(19.6%) 및 Finance Agent(65.4%) 벤치마크에서 유의미한 성능 향상을 보임.
요약
구글의 새로운 AI 모델 Gemini 4 Argon이 주요 벤치마크 테스트에서 강력한 성능 향상을 보였다. 특히 Legal Agent 분야에서 19.6%의 점수를 기록하며 기존 대비 12.9%p 상승했고, 256K~1M 범위의 GraphWalks 테스트에서도 84.2%로 12.4%p 향상된 성과를 나타냈다. AutomationBench와 Finance Agent v2에서도 각각 51.3%와 65.4%를 기록하며 실무 활용 능력을 입증했다. 이외에도 LVBench 91.7%, LABBench 2 88.8%, DeepSWE 77.9%, Vibe Code Bench 91.9% 등 다양한 평가 지표에서 고른 성적을 거두었다. 특히 GraphWalks ≤128K 평가에서는 99.7%라는 매우 높은 점수를 기록하며 모델의 연산 및 추론 역량이 대폭 강화되었음을 보여준다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Conor_D_Dart: Gemini 4 Argon looks seriously strong. Some of its biggest benchmark wins: • Legal Agent: 19.6% (+12.9 pts) • 256K–1M GraphWalks:
원문 보기 ↗