← promppy_ 실시간 AI 뉴스
참고X

Claude Opus 5.5, 실제 코드베이스 버그 수정 성능 벤치마크 공개

105개 실제 버그 수정 테스트 결과, Opus 5.5가 GPT-6 Astra와 유사한 수준의 디버깅 성능을 보이면서 비용 효율성에서 우위를 점함.

요약

X 사용자 Pawel Huryn이 2개의 코드 저장소 내 105개의 난이도 높은 버그를 대상으로 최신 AI 모델들의 수정 능력을 테스트한 결과를 공개했다. 테스트 결과 GPT-6 Astra(max)가 45개의 버그를 수정하며 가장 높은 성능을 보였고, 뒤를 이어 Fable 5.1(max)과 Opus 5.5(max)가 각각 43개를 해결했다. 비용 효율성 측면에서는 Muse Spark 1.3(max)이 18.11달러의 비용으로 32.2개의 버그를 수정하며 두각을 나타냈다. 이번 평가는 모델 가족(model family)이 다른 심판들이 비공개 정답지와 비교해 채점하는 방식을 사용했으며, 미완성 솔루션이나 수정되지 않은 버그는 0점으로 처리되었다. 테스트에 사용된 105개의 버그는 과거 프론티어 모델들이 해결하지 못했던 난제들 위주로 구성되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @PawelHuryn: So I tested Opus 5.5 (max) on real work. 2 repos. 105 planted bugs. Find and fix what you can. The results: GPT-6 Astra (max): 45

원문 보기 ↗

광고

다음 뉴스 →

중요앤트로픽, Claude Opus 5.5 공개…지능 지수 1위에 운영 비용 40% 절감

에이전틱 코딩·복잡 추론에서 최고 성능. Claude 기반 서비스라면 비용·성능 재검토 시점.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스