Hugging Face(허깅페이스), Nemotron 파인튜닝으로 IMO·IOI 금메달 수준 달성
범용 모델을 특정 도메인 전문가로 튜닝하는 효율적인 파이프라인 제시. 고난도 추론 태스크 최적화에 참고 가능.
요약
NVIDIA는 Nemotron-3 모델을 미세 조정(SFT) 및 강화 학습(RL) 기법을 통해 IMO 2026 및 IOI 2026에서 금메달 수준의 성과를 거두는 전문 모델로 발전시켰다. 특히 IOI 성과는 인간 참가자와 동일한 환경 및 제약 조건 하에서 달성되었으며, IMO의 경우 공식 채점단의 평가를 거쳤다. 이번 프로젝트는 범용 모델인 Nemotron을 특정 고난도 도메인에 효과적으로 특화할 수 있는 재사용 가능한 훈련 레시피를 입증했다. 경쟁 프로그래밍을 위해 22,000개의 문제를 큐레이션하고 합성 추론 데이터를 생성하여 두 가지 전문 모델을 구축했다. 300억 파라미터(활성 30억) 규모의 Nemotron-3-Nano-CC에는 SFT와 RL이 적용되었고, 5,500억 파라미터(활성 550억) 규모의 Nemotron-3-Ultra-CC는 SFT를 통해 훈련되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
원문 보기 ↗