중요X
GPT-6 Luna, ARC-AGI 검증 결과 공개…GPT-5.6 대비 비용 62% 절감
동급 성능을 62% 낮은 비용에 달성. 추론 워크로드 비용 최적화 재검토 필요.
요약
OpenAI의 최신 모델인 GPT-6 Luna가 ARC-AGI 벤치마크 테스트에서 검증된 성능을 공개했다. ARC-AGI-3의 경우 표준 하네스 기준 0.19%, 제공자 어댑터 하네스 기준 0.59%의 정확도를 기록했다. ARC-AGI-2는 59.3%, ARC-AGI-1은 86.7%의 점수를 달성했다. 이번 모델은 기존 GPT-5.6 Luna와 유사한 수준의 점수를 보였으나, 비용은 약 62% 절감된 효율성을 나타냈다. 구체적인 작업당 비용은 ARC-AGI-2에서 0.062달러, ARC-AGI-1에서 0.018달러로 확인되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arcprize: GPT-6 Luna from @OpenAI on ARC-AGI (Verified): - ARC-AGI-3: 0.19%, $241 (standard harness), 0.59%, $237 (provider adapter harness)
원문 보기 ↗