← promppy_ 실시간 AI 뉴스
참고Reddit

LLM GRPO 학습 실험 결과: 모델 규모와 성능의 비선형적 관계 보고

GRPO 적용 시 모델 규모와 관계없이 학습 결과가 상이하게 나타난 실험 데이터. 모델 튜닝 전략 수립 시 참고.

요약

최근 한 연구자가 353M, 316M, 672M 파라미터 규모의 소형 LLM 3종을 PyTorch로 직접 학습시킨 뒤, 동일한 SFT 및 GRPO(Group Relative Policy Optimization) 과정을 적용해 성능을 비교했다. 실험 결과, 사전 학습(Pre-training) 단계에서는 모델이 커지고 기법이 고도화될수록 검증 손실(val loss)이 2.8659에서 2.5885까지 순차적으로 감소하며 예상대로 작동했다. 그러나 GRPO 적용 단계에서는 이러한 규모의 법칙이 적용되지 않았으며, 오히려 V2(316M)와 V3(672M) 모델의 성능이 저하되는 현상이 나타났다. 동일한 합성 산술 커리큘럼, 보상 함수, 하이퍼파라미터 및 KL 계수를 사용했음에도 모델 규모와 성능 향상 간의 일관된 상관관계가 확인되지 않았다. 이번 실험은 GRPO와 같은 강화학습 기법이 모든 모델 규모에서 균일하게 작동하지 않을 수 있음을 시사한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Same GRPO recipe on three from-scratch LLMs (353M/316M/672M) gave three different outcomes, with no clean relationship to scale [P]

원문 보기 ↗
다음 뉴스 →

중요바이낸스, AI 에이전트 자율 거래 플랫폼 'Agent OS' 출시…MCP·Cursor·Claude Code 연동

에이전트가 실제 자금을 굴리는 시대. MCP·API 연동으로 거래봇 구축 가능하나 통제 책임은 사용자 몫.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스