중요X
Claude Opus 5.5, ARC-AGI-2 93.3% 기록하며 평가 비용 80% 절감
Opus 5 대비 성능 오르고 태스크당 비용 급감. 추론 헤비 워크로드 재검토 가치.
요약
Anthropic의 신규 모델 Opus 5.5가 ARC-AGI 벤치마크에서 뛰어난 성능을 입증했다. 검증 결과 Opus 5.5는 ARC-AGI-2에서 93.3%(태스크당 0.41달러), ARC-AGI-1에서 98.5%(태스크당 0.16달러)의 정확도를 기록했다. 이는 이전 모델인 Opus 5 대비 v2에서 2.9%p, v1에서 1.0%p 향상된 수치이다. 특히 평가 비용을 기존 대비 약 80% 절감하면서도 성능 개선을 이뤄낸 점이 주목된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arcprize: Opus 5.5 from @AnthropicAI on ARC-AGI (Verified): - ARC-AGI-2: 93.3%, $0.41/task - ARC-AGI-1: 98.5%, $0.16/task Opus 5.5 outscored
원문 보기 ↗