← promppy_ 실시간 AI 뉴스
중요X

GPT-6 Sol 실무 버그 테스트: 성능 급락하지만 비용은 최저

버그 105개 중 29.3개 해결로 최하위지만 비용은 $9.93로 최저—단순 작업에 저가 옵션 검토 가치.

요약

소프트웨어 개발자 파벨 휴린(Pawel Huryn)은 2개의 실제 코드 저장소에서 발견된 105개의 숨겨진 버그를 대상으로 최신 AI 모델들의 성능을 테스트했다. 테스트 결과, GPT-6 Sol 모델의 버그 수정 점수는 29.3점으로, GPT-6 Astra(45점)와 GPT-5.6 Sol(43.5점) 등 다른 상위 모델 대비 성능이 상당히 저하된 것으로 나타났다. 다만, API 사용 비용 측면에서는 GPT-6 Sol이 9.93달러로 가장 경제적이었으며, GPT-6 Astra(33.04달러)나 GPT-5.6 Sol(95.25달러)보다 훨씬 저렴했다. 이번 평가는 모델들이 초기에 해결하지 못했던 난이도 높은 버그들을 대상으로 진행되었으며, 서로 다른 모델 제품군에서 선발된 심사위원들이 비밀 정답지를 기준으로 점수를 매겼다. 더 자세한 모델별 성능 및 비용 데이터는 bughunt.productcompass.pm에서 확인할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @PawelHuryn: I finally tested GPT-6 Sol on a real work. 2 repos. 105 hidden bugs. Find and fixed what you can. It looks like a huge degradation

원문 보기 ↗

광고

다음 뉴스 →

중요샘 올트먼, 유엔 안보리서 'AI 통제력 상실 가능성' 경고

기업 아닌 정부 주도 규제론 부상. 향후 AI 규제 강화 흐름에 대비할 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스