Anthropic 'Fable 5', ARC-AGI 벤치마크 역대 최고 점수 기록
ARC-AGI-2 89.2%로 추론 성능 최상위. 복잡한 추론 태스크 모델 선정 시 후보로 검토.
요약
AnthropicAI의 최신 모델인 Fable 5가 ARC-AGI 벤치마크 평가에서 역대 최고 수준의 성과를 기록했다. ARC-AGI-1 데이터셋에서 98.5%의 정확도를 달성하며 지금까지 평가된 모델 중 가장 높은 점수를 얻었다. 또한, 더 난도가 높은 ARC-AGI-2 테스트에서도 89.2%의 정답률을 기록하며 뛰어난 범용 인공지능 추론 능력을 입증했다. 비용 측면에서는 ARC-AGI-1 수행 시 태스크당 1.02달러, ARC-AGI-2 수행 시 태스크당 5.45달러의 비용이 소요되는 것으로 확인되었다. 이번 Fable 5의 결과는 ARC-AGI 평가 지표에서 고성능 AI 모델의 새로운 기준을 제시한 것으로 평가받는다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arcprize: Fable 5 from @AnthropicAI on ARC-AGI (Verified): - ARC-AGI-2: 89.2%, $5.45/task - ARC-AGI-1: 98.5%, $1.02/task Fable 5 is the high
원문 보기 ↗