코딩 모델 30종 벤치마크: 가성비 중심의 모델 라우팅 전략 공유
고가 모델 단일 사용보다 Opus-5와 저가 모델을 작업별로 혼용할 때 비용 절감 효율이 압도적임을 시사.
요약
최근 29개의 코딩 모델을 대상으로 1,500개 이상의 실제 엔지니어링 작업을 수행한 벤치마크 결과가 공개되었습니다. 테스트 결과 Opus-5 모델이 60점 만점에 54.5점으로 가장 높은 성능을 보였으나, 전체 비용은 약 135달러가 소요되었습니다. 반면 DeepSeek-v4.1-flash 모델은 50.5점을 기록하며 Opus-5 대비 93% 수준의 성능을 보이면서도 비용은 2.67달러에 불과해 극명한 효율성 차이를 나타냈습니다. 조사 대상 29개 모델 중 21개가 더 저렴한 모델과 대등하거나 더 나은 성과를 냈습니다. 이에 따라 특정 모델을 고집하기보다 복잡한 판단이 필요한 작업에만 고성능 모델을 사용하고 나머지에는 저렴한 모델을 병행하는 전략을 적용한 결과, 비용을 대폭 절감하면서도 53.5점이라는 높은 점수를 유지할 수 있었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 benchmarked ~30 coding models on over 1,500 real engineering tasks against real codebases. one got 93% of the top score for 2% of the cost.
원문 보기 ↗