LLM GRPO 학습 실험 결과: 모델 규모와 성능의 비선형적 관계 보고
GRPO 적용 시 모델 규모와 관계없이 학습 결과가 상이하게 나타난 실험 데이터. 모델 튜닝 전략 수립 시 참고.
요약
최근 한 연구자가 353M, 316M, 672M 파라미터 규모의 소형 LLM 3종을 PyTorch로 직접 학습시킨 뒤, 동일한 SFT 및 GRPO(Group Relative Policy Optimization) 과정을 적용해 성능을 비교했다. 실험 결과, 사전 학습(Pre-training) 단계에서는 모델이 커지고 기법이 고도화될수록 검증 손실(val loss)이 2.8659에서 2.5885까지 순차적으로 감소하며 예상대로 작동했다. 그러나 GRPO 적용 단계에서는 이러한 규모의 법칙이 적용되지 않았으며, 오히려 V2(316M)와 V3(672M) 모델의 성능이 저하되는 현상이 나타났다. 동일한 합성 산술 커리큘럼, 보상 함수, 하이퍼파라미터 및 KL 계수를 사용했음에도 모델 규모와 성능 향상 간의 일관된 상관관계가 확인되지 않았다. 이번 실험은 GRPO와 같은 강화학습 기법이 모든 모델 규모에서 균일하게 작동하지 않을 수 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Same GRPO recipe on three from-scratch LLMs (353M/316M/672M) gave three different outcomes, with no clean relationship to scale [P]
원문 보기 ↗