Artificial Analysis: Claude Haiku 5.5(클로드 하이쿠 5.5), 벤치마크 및 토큰 효율성 상세 분석
기존 모델 대비 가성비 및 토큰 소모 특성 분석. 에이전트 서비스 비용 최적화 전략 수립 시 참고 데이터.
요약
Anthropic은 'Artificial Analysis Intelligence Index'에서 43점을 기록하며 이전 모델 대비 26점 상승한 Claude Haiku 5.5를 출시했다. 이번 모델은 Anthropic의 'effort settings'과 'adaptive thinking' 기능을 적용한 첫 Haiku 모델로, 100k 토큰까지는 1M 토큰당 $0.10/$0.50, 그 초과 시 5배 인상된 가격이 적용되는 계층화된 요금제를 도입했다. 성능 면에서 Haiku 5.5(max)는 GLM-5.3 Flash(42), Gemini 3.8 Flash(41), GPT-6 Luna(38)를 앞섰으며, 에이전트 지식 업무 평가인 AA-Briefcase에서는 1578 Elo를 기록해 동급 모델 중 우수한 성능을 입증했다. 특히 Terminal-Bench 4.0에서 33%의 정확도를 보여 이전 모델(0%) 대비 비약적인 발전을 이루었으나, 팩트 기반 지식 평가는 36%로 경쟁 모델 대비 다소 낮게 나타났다. 다만, Haiku 5.5는 모르는 정보에 대해 솔직하게 답변하는 경향이 강해 환각 현상(hallucination) 비율은 40%로 타 모델들보다 낮게 측정되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ArtificialAnlys: Anthropic has released Claude Haiku 5.5, scoring 43 on the Artificial Analysis Intelligence Index - up 26 points one year after th
원문 보기 ↗