← promppy_ 실시간 AI 뉴스
참고HF Papers

Teacher 모델 없는 강화학습 기법 'Self-OPD' 공개

고비용의 Teacher 모델 없이 플로우 매칭 모델을 학습시키는 효율적 프레임워크. 최적화 연구 시 참고.

요약

최근 LLM에서 주로 사용되던 온-정책 증류(On-policy Distillation, OPD) 기법이 플로우 매칭 모델로 확장되었으나, 별도의 교사 모델 학습에 따른 높은 비용과 교사-학생 분포 불일치 문제가 지적되었습니다. 이에 대한 해결책으로 제안된 Self-OPD는 교사 모델 없이 학생 모델의 탐색을 단계별 지도 학습으로 활용하는 프레임워크입니다. 이 방식은 각 타임스텝마다 결정론적 예측을 K개의 확률적 SDE 후보로 분기하고, ODE 샘플러로 롤아웃하여 보상을 비교함으로써 정규화된 이점을 산출합니다. 학습 시 높은 이점을 가진 분기는 학생 모델을 유인하고 낮은 이점의 분기는 밀어내는 'pull-push' 목적 함수를 사용하여 벨로시티 필드를 최적화합니다. 또한 다중 목적 정렬 시 보상 수준에서 점수를 융합하여 기울기 충돌을 방지합니다. 실험 결과, Self-OPD는 단일 및 혼합 보상 벤치마크에서 기존 RL 및 OPD 방식들을 능가하는 성능을 입증했습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

원문 보기 ↗
다음 뉴스 →

중요엔비디아, 미디어텍에 4.7조 투자…GPU 넘어 'AI 인프라 표준' 노린다

빅테크 자체 칩 확대에 대응해 연결·아키텍처 표준화로 락인 강화. NVLink 종속성 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

최신 뉴스