Qwen3.8 Max, 에이전트 벤치마크 1위 등극
에이전트 성능 평가에서 Qwen 신규 모델이 최상위권 달성. 모델 선정 시 벤치마크 지표 변화 확인 필요.
요약
Artificial Analysis가 발표한 Intelligence Index v4.1.1에서 Qwen3.8 Max가 종합 성능 1위 모델로 등극했다. 이번 업데이트에서는 𝜏³-Banking v1.0.1이 적용되었으며, HLE, AA-LCR, AA-Omniscience 평가 모델이 GPT-5.6 Luna(medium)로 업그레이드되었다. Intelligence Index v4.1.1은 GDPval-AA v2, Terminal-Bench v2.1, SciCode, Humanity's Last Exam 등 다양한 벤치마크를 포함하여 AI 모델의 지능을 객관적으로 측정한다. 이번 벤치마크 데이터는 모델별 지능, 속도, 비용 등 주요 지표를 기반으로 하여 실무자가 적합한 모델과 제공자를 선택하는 데 도움을 준다. 또한 사용자는 플랫폼 지원 및 에이전트 기능을 비교하여 업무 목적에 맞는 최적의 모델을 탐색할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8 Max now ranked as the best overall model by agentic index
원문 보기 ↗