연구 계획 생성 최적화 프레임워크 'PaperGym' 공개
연구 논문을 학습 환경으로 변환하여 모델의 연구 계획 능력을 향상시키는 파이프라인으로, Qwen3 모델 성능 개선에 활용 가능합니다.
요약
AI 연구 계획 생성의 핵심인 검증 가능한 환경 구축을 위해, 논문에서 추출한 평가 기준을 활용하는 새로운 프레임워크인 PaperGym이 공개되었습니다. 기존 방식의 문제점인 평가 기준 누출을 3.7% 수준으로 대폭 낮췄으며, 논문의 연구 목표와 배경에서 질문을, 방법론과 실험에서 평가 기준을 도출하여 2만 건의 학습 데이터셋인 PaperGym-20k를 구성했습니다. 학습 과정에서는 평가 기준을 OPSD의 셀프 티처 문맥과 GRPO의 보상으로 이중 활용하는 방식을 채택했습니다. Qwen3-1.7B/4B/8B 모델에 적용한 결과, 기존 지도 미세 조정보다 5개 벤치마크 평균 점수가 최대 5.6점 향상되는 성능을 보였습니다. 특히 Qwen3-8B는 ResearchQA에서 73.48점을 기록하며 대규모 모델인 Kimi K2.6을 앞질렀으며, 현재 파이프라인과 데이터셋, 벤치마크가 함께 공개되었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 PaperGym: Rubric-Centered Evolution for Research-Plan Generation
원문 보기 ↗