GPT-6 Sol·Luna 벤치마크 및 비용 효율성 분석
주요 벤치마크 점수와 모델별 작업당 비용 비교를 통해 인프라 최적화 의사결정을 지원합니다.
요약
최근 공개된 GPT-6 Sol 및 Luna 모델의 벤치마크 결과가 기존 Fable 모델과 유사한 성능을 보이면서 비용 효율성은 크게 개선된 것으로 나타났다. FrontierCode 평가에서 GPT-6 Sol은 48.4%의 성능으로 Fable 5.1(48.7%)과 대등했으나 비용은 작업당 $1.37로 Fable 대비 약 85% 저렴했다. DeepSWE 테스트에서도 GPT-6 Sol은 68.8%의 성능을 기록해 Fable 5(69.9%)에 근접했으며, 비용은 $2.74로 약 80%의 절감 효과를 보였다. 또한 AutomationBench에서는 GPT-6 Sol이 33.2%의 성능으로 Fable 5.1(31.4%)을 상회하면서 비용은 최소 $2.45에서 $0.27로 대폭 낮췄다. 특히 GPT-6 Luna 모델은 DeepSWE에서 66.6% 성능을 기록하며 Fable 5를 앞섰고, 작업당 비용도 $0.22로 약 96% 저렴하게 측정되었다. 현재 API 가격은 Sol 모델이 백만 토큰당 입력 $2/출력 $10, Luna 모델이 입력 $0.10/출력 $0.50 수준이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: Benchmarks GPT-6 Sol & Luna: • FrontierCode: 48.4% vs. Fable 5.1’s 48.7%, both at xhigh. $1.37 vs. $9.27 per task, roughly 85% che
원문 보기 ↗