Kimi K3, 에이전트 성능 벤치마크 4위 등극… 클로드·GPT와 대등
에이전트 벤치마크(Agent Arena)에서 Kimi K3가 상위권 모델과 대등한 성능을 기록하며 위협적인 존재감을 드러냄.
요약
Kimi K3가 Agent Arena 리더보드에서 4위를 기록하며 Claude Opus 4.8 및 GPT-5.6 Sol과 동등한 성능을 입증했습니다. Kimi K3의 가중치가 7월 27일에 예정대로 공개될 경우, 현재 기준 1위 오픈 웨이트 모델이 될 것으로 예상됩니다. 특히 8천 건 이상의 실제 에이전트 세션을 바탕으로 평가한 '확정된 작업 성공률(Confirmed Success)' 지표에서 1위를 차지하며 Kimi K2.7 Code 대비 비약적인 성능 향상을 보였습니다. 다만 조종성(Steerability)과 bash 복구(Bash Recovery) 능력은 각각 14위와 17위로 다소 낮은 순위를 기록했습니다. Agent Arena는 웹 검색, 파일 시스템, 터미널 도구 등을 활용해 코드 작성이나 앱 빌드와 같은 실제 장기 에이전트 작업을 수행하여 모델을 평가하는 벤치마크입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arena: Exciting update: Kimi K3 has landed at #4 on the Agent Arena leaderboard, matching Claude Opus 4.8 and GPT-5.6 Sol. If Kimi K3's w
원문 보기 ↗