중요X
DeepSeek V4 Flash, ARC-AGI 검증서 비용 대비 성능 신기록
ARC-AGI-2 61.4%를 태스크당 $0.04에 달성. 저비용 추론 모델 후보로 검토 가치.
요약
DeepSeek AI가 공개한 최신 모델 DeepSeek V4 Flash가 ARC-AGI 벤치마크에서 뛰어난 성능과 비용 효율성을 입증했다. 검증 결과, ARC-AGI-2에서 61.4%의 정답률을 기록하며 태스크당 0.04달러의 비용을 보였다. 또한 ARC-AGI-1에서는 89.0%의 정답률을 달성했으며, 비용은 태스크당 0.02달러로 확인됐다. 이번 결과는 DeepSeek V4 Flash가 모델의 성능과 비용 사이의 효율성을 극대화한 새로운 표준을 제시했음을 보여준다. 업계에서는 이 모델이 비용 대비 성능(Pareto frontier) 측면에서 경쟁력 있는 선택지가 될 것으로 평가하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arcprize: DeepSeek V4 Flash from @deepseek_ai on ARC-AGI (Verified): - ARC-AGI-2: 61.4%, $0.04/task - ARC-AGI-1: 89.0%, $0.02/task DeepSeek
원문 보기 ↗