← promppy_ 실시간 AI 뉴스
참고HF Papers

no-CoT 데이터 학습, RL보다 SFT 조합이 효율·성능 우위

no-CoT 데이터 활용 시 RL보다 SFT 조합이 학습 효율과 성능 면에서 더 우수하다는 연구 결과.

요약

최근 연구는 명시적인 사고 과정(CoT) 주석이 없는 데이터(no-CoT data)를 활용하기 위해 'next-chunk reasoning RL' 방식을 제안했으나, 이 방식이 RL 자체의 효과인지 단순히 데이터를 더 잘 활용한 결과인지에 대한 의문이 제기되었습니다. 연구진은 이를 검증하기 위해 no-CoT 데이터와 긴 CoT 데이터를 동시에 학습시키는 'Mixed SFT' 방식을 제안하고 비교 실험을 진행했습니다. 실험 결과, Mixed SFT는 next-chunk reasoning RL보다 60배 이상 적은 컴퓨팅 자원을 사용하면서도, RLVR(Reinforcement Learning from Verifiable Rewards) 이후의 최종 성능은 더 높게 나타났습니다. 이러한 성능 우위는 도메인 내 수학적 추론과 도메인 밖 추론 작업 모두에서 일관되게 확인되었습니다. 또한, 연구는 RL 이전 단계의 정확도가 반드시 RL 이후의 성능 향상으로 직결되지 않는다는 점을 지적하며, no-CoT 학습 전략 평가 시 전체 사후 학습 파이프라인 관점에서 접근해야 한다고 강조했습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

원문 보기 ↗
다음 뉴스 →

중요엔비디아, 미디어텍에 4.7조 투자…GPU 넘어 'AI 인프라 표준' 노린다

빅테크 자체 칩 확대에 대응해 연결·아키텍처 표준화로 락인 강화. NVLink 종속성 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스