GPT-6.1 Sol 벤치마크 결과: 가성비 대폭 개선
기존 GPT-6 Sol 대비 비용 효율이 압도적입니다. 실무 API 활용 시 비용 절감 및 마이그레이션을 검토하십시오.
요약
X 사용자 PawelHuryn이 2개의 저장소와 105개의 의도된 버그를 활용해 GPT-6.1 Sol 모델의 실제 업무 수행 능력을 테스트했다. 테스트 결과 GPT-6.1 Sol(max)은 44개의 버그를 6.56달러의 비용으로 해결하며 높은 효율성을 입증했다. 이는 GPT-6 Astra(max)가 45개의 버그를 33달러에 해결한 것과 비교했을 때 비용 대비 성능이 월등히 우수함을 보여준다. 기존 GPT-5.6 Sol(max)은 43.5개의 버그를 해결했으나 비용은 95.35달러로 훨씬 높았다. 결과적으로 GPT-6.1 Sol은 실무적인 코드 수정 작업에서 유의미한 생산성을 나타내며 AI 모델의 가성비를 한층 높였다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @PawelHuryn: So I tested GPT-6.1 Sol on real work: 2 repos, 105 planted bugs. Find and fix what you can. Unlike GPT-6 Sol, which was just a ner
원문 보기 ↗