RLVR 학습의 신뢰성 향상: 데이터 정책 평가를 위한 프레임워크 제안
데이터 샘플링 전략이 모델 성능에 미치는 영향을 격리하여, 재현 가능한 학습 정책을 수립하는 기술적 방법론.
요약
RLVR(Reinforcement Learning with Verifiable Rewards) 학습에서 데이터 스케줄링 전략은 학습 과정에 큰 영향을 미치지만, 이를 개별적으로 검증하기는 어렵습니다. 모델, 롤아웃 예산, 난수 시드, 평가 벤치마크 등 다양한 변수가 학습 결과에 개입하여 특정 데이터 정책의 효과나 재현성을 판단하기 어렵게 만들기 때문입니다. 이를 해결하기 위해 공유 GRPO 프레임워크를 기반으로 학습 환경의 다른 변수를 고정한 상태에서 데이터 정책만을 독립적으로 평가하는 방식이 도입되고 있습니다. 데이터 정책은 크게 롤아웃 포함 여부를 결정하는 선택(Selection), 샘플 가중치를 조절하는 할당(Weighting), 도메인별 샘플링 비율을 관리하는 스케줄링(Scheduling)의 세 가지 유형으로 구분합니다. 이러한 접근법은 데이터 전략의 실효성을 명확히 파악하고 연구 결과를 재현 가능하도록 돕는 데 목적이 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 OSS: Making RLVR Data Policies Reliable and Reproducible
원문 보기 ↗