← promppy_ 실시간 AI 뉴스
참고X

Kimi K3, 에이전트 벤치마크 'AA-Briefcase' 2위 기록

Kimi K3가 에이전트 지식 업무 벤치마크에서 Claude Fable 5 다음가는 고성능을 입증했습니다.

요약

Moonshot AI가 최근 공개한 2.8T 파라미터 모델 Kimi K3는 에이전트 지식 업무 벤치마크인 AA-Briefcase에서 Elo 1543을 기록하며 Claude Fable 5(1574)에 이어 전체 2위를 차지했습니다. Kimi K3는 분석 품질 Elo 1754로 Claude Fable 5와 대등한 수준을 보였으나, 프레젠테이션 품질(Elo 1471)과 비교하면 분석 역량에 비해 상대적으로 낮은 평가를 받았습니다. 비용 측면에서는 작업당 평균 10.57달러가 소요되어 이전 모델인 Kimi K2.6 대비 약 10배 증가했으며, 이는 높은 토큰 사용량과 작업당 평균 83회의 턴 사용에 기인합니다. 또한 Kimi K3는 평균 56.4분의 작업 처리 시간을 기록하며, 높은 턴 수와 출력 토큰 사용량, Kimi API의 상대적으로 느린 속도로 인해 현재 AA-Briefcase 내에서 가장 운영 비용이 높은 모델 중 하나로 꼽힙니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @ArtificialAnlys: Kimi K3 is second only to Fable 5 on AA-Briefcase, our agentic knowledge work benchmark, but costs more than Opus 4.8 to run while

원문 보기 ↗
다음 뉴스 →

중요백악관, 급부상한 중국 AI 대응 놓고 내부 이견…'증류' 차단 논의

미국이 자국 모델 무단 증류 규제를 검토 중. 오픈모델 활용·중국계 모델 도입 시 법적 리스크 주시 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스