no-CoT 데이터 학습, RL보다 SFT 조합이 효율·성능 우위
no-CoT 데이터 활용 시 RL보다 SFT 조합이 학습 효율과 성능 면에서 더 우수하다는 연구 결과.
요약
최근 연구는 명시적인 사고 과정(CoT) 주석이 없는 데이터(no-CoT data)를 활용하기 위해 'next-chunk reasoning RL' 방식을 제안했으나, 이 방식이 RL 자체의 효과인지 단순히 데이터를 더 잘 활용한 결과인지에 대한 의문이 제기되었습니다. 연구진은 이를 검증하기 위해 no-CoT 데이터와 긴 CoT 데이터를 동시에 학습시키는 'Mixed SFT' 방식을 제안하고 비교 실험을 진행했습니다. 실험 결과, Mixed SFT는 next-chunk reasoning RL보다 60배 이상 적은 컴퓨팅 자원을 사용하면서도, RLVR(Reinforcement Learning from Verifiable Rewards) 이후의 최종 성능은 더 높게 나타났습니다. 이러한 성능 우위는 도메인 내 수학적 추론과 도메인 밖 추론 작업 모두에서 일관되게 확인되었습니다. 또한, 연구는 RL 이전 단계의 정확도가 반드시 RL 이후의 성능 향상으로 직결되지 않는다는 점을 지적하며, no-CoT 학습 전략 평가 시 전체 사후 학습 파이프라인 관점에서 접근해야 한다고 강조했습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
원문 보기 ↗