LLM 코딩 성능을 파라미터 밀도로 재해석한 'Agentic Coding Index' 등장
다양한 벤치마크를 파라미터 밀도로 정규화해 모델 효율성을 평가하는 새로운 기준. 모델 선정 시 참고.
요약
최근 한 사용자가 주요 LLM 코딩 벤치마크 점수를 통합한 'Agentic Coding Index'를 기반으로 모델별 지능 밀도(Intelligence Density)를 산출해 공개했다. 이 지수는 SWE-bench Pro, DeepSWE v1.1, Terminal-Bench(v4, v3, v2.1), Code Arena Elo, LiveCodeBench v6 등 다수의 코딩 벤치마크 데이터를 집계하여 산출되었다. 지능 밀도 계산식에는 매개변수 수(PCount)에 따른 비선형 보정을 위해 2.5354의 Super_Linear_Exponent와 8B의 매개변수 하한선(PLowerBound)이 적용되었다. 이는 단순히 매개변수가 적은 소형 모델이 점수를 독점하는 것을 방지하고, 모델의 진정한 자율 코딩 능력을 평가하기 위한 시도이다. 실무자는 이 새로운 지표를 통해 단순히 모델의 파라미터 규모뿐만 아니라 효율성 측면에서 코딩 성능을 가늠할 수 있게 되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I collected every single LLM coding benchmark, and computed their Intelligence Density
원문 보기 ↗