Anthropic Claude 3.5 Sonnet, 에이전트 코딩 성능 논란
벤치마크상 가성비와 성능 면에서 최신 오픈 웨이트 모델 대비 경쟁력이 낮다는 비판적 분석 제기.
요약
최근 앤스로픽(Anthropic)이 출시한 Claude 3.5 Sonnet(본문 내 Sonnet 5로 지칭)의 에이전트 코딩 성능이 오픈 웨이트 모델 대비 기대 이하라는 평가가 제기됐다. 특정 성능 테스트에서 Claude 3.5 Sonnet은 54%의 성공률을 기록했으나, 가격은 214k 토큰 기준 26.40달러로 경쟁 모델 대비 매우 높게 책정되었다. 반면 오픈 웨이트 모델들은 훨씬 저렴한 비용으로 더 높은 성능을 보였다. Kimi k3는 69% 성공률에 4.65달러, DeepSeek V4 Pro는 63% 성공률에 0.24달러, Qwen 3.8 Max는 57% 성공률에 3.73달러를 기록했다. 이러한 비교 지표는 비용 효율성 측면에서 Claude 3.5 Sonnet이 에이전트 워크플로우에 적합하지 않다는 주장의 근거가 되고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @haider1: sonnet 5 is a disastrous release from anthropic, at least for agentic coding look at how badly the open-weight models are mogging
원문 보기 ↗