OpenAI GPT-6.1 Sol, ARC-AGI 검증 결과 공개…비용 대폭 절감
ARC-AGI-3서 GPT-6 Astra급 성능을 77% 저렴하게. 고난도 추론 태스크 비용 재검토 여지.
요약
OpenAI의 GPT-6.1 Sol 모델이 ARC-AGI 벤치마크에서 우수한 성능을 검증받았다. ARC-AGI-3 테스트에서 표준 하네스 기준 52.7%, 프로바이더 어댑터 하네스 기준 96.4%의 정확도를 기록했으며, 비용은 각각 7,600달러와 4,400달러가 소요되었다. 또한 ARC-AGI-2와 ARC-AGI-1에서는 각각 94.2%(태스크당 0.25달러)와 98.5%(태스크당 0.06달러)의 높은 정확도를 보였다. 특히 ARC-AGI-3의 96.4% 정확도는 GPT-6 Astra의 99.9%와 비교할 만한 수준이면서도 비용은 77% 절감한 결과다. 이번 결과는 ARC-AGI 벤치마크상에서 모델 효율성과 성능 간의 최적화 가능성을 보여준다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arcprize: GPT-6.1 Sol from @OpenAI on ARC-AGI (Verified): - ARC-AGI-3: 52.7%, $7.6K (standard harness), 96.4%, $4.4K (provider adapter harne
원문 보기 ↗