GPT-6 Sol 실무 버그 테스트: 성능 급락하지만 비용은 최저
버그 105개 중 29.3개 해결로 최하위지만 비용은 $9.93로 최저—단순 작업에 저가 옵션 검토 가치.
요약
소프트웨어 개발자 파벨 휴린(Pawel Huryn)은 2개의 실제 코드 저장소에서 발견된 105개의 숨겨진 버그를 대상으로 최신 AI 모델들의 성능을 테스트했다. 테스트 결과, GPT-6 Sol 모델의 버그 수정 점수는 29.3점으로, GPT-6 Astra(45점)와 GPT-5.6 Sol(43.5점) 등 다른 상위 모델 대비 성능이 상당히 저하된 것으로 나타났다. 다만, API 사용 비용 측면에서는 GPT-6 Sol이 9.93달러로 가장 경제적이었으며, GPT-6 Astra(33.04달러)나 GPT-5.6 Sol(95.25달러)보다 훨씬 저렴했다. 이번 평가는 모델들이 초기에 해결하지 못했던 난이도 높은 버그들을 대상으로 진행되었으며, 서로 다른 모델 제품군에서 선발된 심사위원들이 비밀 정답지를 기준으로 점수를 매겼다. 더 자세한 모델별 성능 및 비용 데이터는 bughunt.productcompass.pm에서 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @PawelHuryn: I finally tested GPT-6 Sol on a real work. 2 repos. 105 hidden bugs. Find and fixed what you can. It looks like a huge degradation
원문 보기 ↗