테스트 타임 정책 최적화(TTPO) 연구 발표: 라벨 없이 추론 성능 향상
정답 라벨 없이도 모델 자체 학습을 통해 수학적 추론 능력을 개선하는 기법. TTT 기법에 관심 있는 개발자라면 주목할 만한 논문입니다.
요약
기존 대규모 언어 모델의 테스트 타임 학습(TTT)은 정답 레이블 의존성과 다수결 기반 의사 레이블링의 취약점이라는 한계를 지니고 있다. 본 논문은 이러한 한계를 극복하기 위해 의사 레이블과 일치하는 롤아웃은 On-Policy Self-Distillation(OPSD)으로 증류하고, 불일치하는 롤아웃은 Grouped RL로 패널티를 부여하는 비대칭적 목적 함수인 TTPO(Test-Time Policy Optimization)를 제안한다. 특히 토큰 단위 선택을 적용해 이미 수렴한 위치의 증류 가중치를 낮추고 확신을 가진 오류만을 RL로 교정함으로써 정답 없는 환경에서도 학습 안정성을 확보했다. TTPO는 별도의 레이블 없이도 5개의 경쟁 수준 벤치마크에서 기존 지도 학습 방식인 OPSD와 대등한 성능을 보였다. 또한 Qwen3-1.7B 모델을 대상으로 테스트한 결과, TTT 성능이 기존 38.0%에서 45.2%로 향상되었으며, 사고 과정을 거치지 않는 설정에서도 25.2%~36.4%의 성능 개선을 기록했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 TTPO: Test-Time Policy Optimization
원문 보기 ↗