GPT-5.6 Luna Max vs. Sonnet 5 Max: 코딩 에이전트 벤치마크 공개
코딩 에이전트 성능 지표인 DeepSWE v1.1에서 가성비 높은 대안으로 주목받는 결과입니다. 실무 프로젝트 모델 선택 시 참고하세요.
요약
코딩 에이전트의 성능을 평가하는 벤치마크 'DeepSWE v1.1'에서 GPT-5.6 Luna Max가 Sonnet 5 Max보다 13.3점 높은 점수를 기록했다. 특히 GPT-5.6 Luna Max는 Sonnet 5 Max 대비 44배 저렴한 비용으로 작업을 수행하는 것으로 나타났다. DeepSWE는 113개의 독창적인 장기 엔지니어링 과제를 통해 코딩 에이전트의 능력을 측정한다. GPT-5.6 Luna Max는 해당 테스트에서 67.2%의 성공률과 과제당 0.61달러의 비용 효율성을 보였다. 이는 Gemini 3.7 Flash Medium보다 1.7점 높은 점수이며, 동시에 비용은 70% 더 낮다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @reach_vb: GPT-5.6 Luna Max scores 13.3 points above Sonnet 5 Max on DeepSWE v1.1 while Sonnet costs 44x as much. DeepSWE tests coding agents
원문 보기 ↗