Claude Fable 5.1 (Max), 에이전트 아레나 1위·실사용 순개선 +15.8%
태스크당 중앙값 $4.14로 가성비 최상위, 도구 환각 0건. 에이전트 스택 재평가 가치 있음.
요약
Anthropic의 새로운 모델 Claude Fable 5.1(Max)이 6,700개 이상의 실사용 에이전트 세션을 평가하는 Agent Arena 리더보드에서 1위를 차지했습니다. 해당 모델은 기존 모델 대비 15.8%의 순 성능 향상을 보였으며, 작업당 평균 비용 4.14달러로 가격 대비 성능 면에서 압도적인 효율성을 입증했습니다. 특히 사용자 만족도 지표인 'Praise vs. Complaint'에서 타 모델 대비 약 2배 높은 긍정적 피드백(+42.5%)을 기록했습니다. 기능적으로도 성공률 22.4% 증가, Bash 복구 능력 13.1% 향상을 보였으며, 도구 환각(Tool Hallucinations) 현상은 발생하지 않았습니다. 이번 성과는 웹 검색, 파일 시스템, 터미널 도구를 활용하는 장기 에이전트 작업 환경에서 Claude Fable 5.1(Max)이 기존 Claude 변형 모델 및 경쟁 모델을 크게 앞섰음을 의미합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arena: Claude Fable 5.1 (Max) by @AnthropicAI has landed in the Agent Arena at #1 with +15.8% net improvement across 6.7k+ real-world age
원문 보기 ↗