참고X
Claude Opus 5, ARC-AGI 기반 RL 학습 가능성 제기
Opus 5의 추론 성능 배경으로 ARC-AGI 유사 환경 학습설 제기. 모델 평가 및 한계점 파악에 참고.
요약
Anthropic이 차세대 모델 Opus 5를 ARC-AGI 퍼즐과 유사한 강화학습(RL) 환경에서 훈련하고 있다는 주장이 제기되었다. 해당 과정에서 Anthropic은 인간 계약자를 고용하여 퍼즐 해결 시 사고 과정을 기록하게 하거나, 보상에 기반해 가중치를 업데이트하는 방식을 사용하고 있다. 그러나 이러한 훈련 과정은 폐쇄형 모델인 Opus 5의 특성상 외부에서 확인하기 어렵다. 전문가들은 이러한 방식이 진정한 의미의 일반화(generalization)를 보여주는 것은 아니라고 지적했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @NielsRogge: People don't realize that Anthropic literally trained Opus 5 on RL environments that resemble ARC-AGI puzzles Anthropic pays human
원문 보기 ↗