중요X
ARC 재검증: GPT-5.6 Luna, 80% 가격 인하 후에도 성능 유지
ARC-AGI-2 59.6% 유지에 태스크당 $0.18. 추론 워크로드 비용 재산정 검토 가치.
요약
ARC Prize가 OpenAI의 GPT-5.6 Luna 모델에 대한 ARC-AGI 벤치마크 테스트 결과를 재검증했다. 이번 테스트는 GPT-5.6 Luna의 비용이 기존 대비 80% 인하된 이후 수행되었다. 측정 결과 ARC-AGI-2에서 59.6%의 성능을 기록하며 태스크당 0.18달러의 비용이 소요되었다. 또한 ARC-AGI-1에서는 90.7%의 성능을 보였으며 태스크당 비용은 0.07달러로 나타났다. 결과적으로 GPT-5.6 Luna는 훨씬 낮아진 비용으로 기존의 우수한 성능을 그대로 유지하고 있음이 확인되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arcprize: We re-tested GPT-5.6 Luna from @OpenAI on ARC-AGI (Verified) following its recent 80% price reduction: - ARC-AGI-2: 59.6%, $0.18/t
원문 보기 ↗