← promppy_ 실시간 AI 뉴스
참고X

GPT-5.6 Luna Max vs. Sonnet 5 Max: 코딩 에이전트 벤치마크 공개

코딩 에이전트 성능 지표인 DeepSWE v1.1에서 가성비 높은 대안으로 주목받는 결과입니다. 실무 프로젝트 모델 선택 시 참고하세요.

요약

코딩 에이전트의 성능을 평가하는 벤치마크 'DeepSWE v1.1'에서 GPT-5.6 Luna Max가 Sonnet 5 Max보다 13.3점 높은 점수를 기록했다. 특히 GPT-5.6 Luna Max는 Sonnet 5 Max 대비 44배 저렴한 비용으로 작업을 수행하는 것으로 나타났다. DeepSWE는 113개의 독창적인 장기 엔지니어링 과제를 통해 코딩 에이전트의 능력을 측정한다. GPT-5.6 Luna Max는 해당 테스트에서 67.2%의 성공률과 과제당 0.61달러의 비용 효율성을 보였다. 이는 Gemini 3.7 Flash Medium보다 1.7점 높은 점수이며, 동시에 비용은 70% 더 낮다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @reach_vb: GPT-5.6 Luna Max scores 13.3 points above Sonnet 5 Max on DeepSWE v1.1 while Sonnet costs 44x as much. DeepSWE tests coding agents

원문 보기 ↗
다음 뉴스 →

중요DeepSeek 공식 API 가격 인상, OpenCode 한도도 조정

저가 경쟁력이 핵심이던 DeepSeek 비용 상승. 연동 서비스는 예산 재산정과 대체 모델 검토 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스