← promppy_ 실시간 AI 뉴스
참고Reddit

"Adam은 저랭크 편향을 잃는다": 옵티마이저가 모델 학습에 미치는 기술적 분석

Adam, GD 등 옵티마이저 선택이 모델의 implicit low-rank bias에 미치는 영향을 다룹니다.

요약

팩터화 모델(W = UV^T)에서 손실 함수는 회전 불변성을 가지지만, Adam과 같은 최적화 알고리즘의 좌표별 2차 모멘트 계산 방식은 이 불변성을 깨뜨린다는 연구 결과가 제기되었다. 실험 결과, GD, shared-scalar Adam, Muon, Shampoo는 GD의 암묵적 저랭크(low-rank) 편향을 유지한 반면, Adam, RMSProp, Lion, signum, Adafactor는 이를 잃는 것으로 나타났다. 즉, 좌표별로 다른 스케일링을 적용하는 방식이 저랭크 편향을 상실하게 만드는 핵심 원인이다. 연구자는 Adam의 분모를 단일 스칼라로 변환하는 매개변수를 적용했을 때 행렬 복원 성능이 점진적으로 개선됨을 확인했다. 실무자는 특정 최적화 알고리즘의 비등방성(anisotropy)이 모델의 학습 편향에 영향을 미칠 수 있음을 인지해야 한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 The Loss Does Not See the Basis, But Adam Does [R]

원문 보기 ↗
다음 뉴스 →

중요DoorDash, AI 에이전트로 월 13만 건 엔지니어링 작업 자동화한 아키텍처 공개

태스크별 Firecracker microVM·게이트웨이 격리 구조. 사내 코딩 에이전트 운영 설계에 참고할 실전 청사진.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스