Muon 능가하는 새로운 최적화 알고리즘 'Tauon' 공개
Muon 대비 수렴 속도와 최종 손실값을 개선한 최적화 기법. LLM 학습 효율화에 관심 있는 연구자라면 벤치마크 결과 참고.
요약
Reddit의 r/MachineLearning 커뮤니티에 Muon 옵티마이저를 개선한 새로운 옵티마이저 'Tauon'이 공개되었습니다. Tauon은 다항식과 직교화라는 핵심 아이디어를 유지하면서 스펙트럼 필터링 및 계수 스케줄링을 통해 최적화 단계 수를 2단계로 줄이고 DCT-2를 통해 행렬 크기를 축소했습니다. GPT-Mini(d_model=512, 6 Layers) 모델을 TinyShakespeare 데이터셋으로 학습시킨 결과, Tauon은 최종 검증 손실(Validation Loss) 약 1.6을 기록하여 Muon(약 1.65)과 AdamW(약 1.8)보다 우수한 성능을 보였습니다. 또한, Tauon은 Muon 대비 스텝당 학습 시간을 약 8.5% 단축하는 효율성을 입증했습니다. 해당 옵티마이저는 Muon의 성능을 능가하는 대안으로, 향후 대규모 언어 모델 학습의 최적화 도구로 활용될 가능성을 보여줍니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Tauon: A new optimizer outperforming Muon on GPT-Mini (lower loss, ~8.5% faster step time) [P]
원문 보기 ↗