Claude Opus 5.5, 실제 코드베이스 버그 수정 성능 벤치마크 공개
105개 실제 버그 수정 테스트 결과, Opus 5.5가 GPT-6 Astra와 유사한 수준의 디버깅 성능을 보이면서 비용 효율성에서 우위를 점함.
요약
X 사용자 Pawel Huryn이 2개의 코드 저장소 내 105개의 난이도 높은 버그를 대상으로 최신 AI 모델들의 수정 능력을 테스트한 결과를 공개했다. 테스트 결과 GPT-6 Astra(max)가 45개의 버그를 수정하며 가장 높은 성능을 보였고, 뒤를 이어 Fable 5.1(max)과 Opus 5.5(max)가 각각 43개를 해결했다. 비용 효율성 측면에서는 Muse Spark 1.3(max)이 18.11달러의 비용으로 32.2개의 버그를 수정하며 두각을 나타냈다. 이번 평가는 모델 가족(model family)이 다른 심판들이 비공개 정답지와 비교해 채점하는 방식을 사용했으며, 미완성 솔루션이나 수정되지 않은 버그는 0점으로 처리되었다. 테스트에 사용된 105개의 버그는 과거 프론티어 모델들이 해결하지 못했던 난제들 위주로 구성되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @PawelHuryn: So I tested Opus 5.5 (max) on real work. 2 repos. 105 planted bugs. Find and fix what you can. The results: GPT-6 Astra (max): 45
원문 보기 ↗