참고Hacker News
역전파(Backprop) 없는 트랜스포머 사전 학습 연구 'Dust' 공개
미분 가능성에 의존하지 않는 새로운 학습 알고리즘 연구. 대규모 연산 자원 기반의 모델 학습 패러다임 변화 가능성 시사.
요약
최신 딥러닝과 트랜스포머 기반 언어 모델은 역전파(Backpropagation)에 전적으로 의존해 발전해 왔으나, 이는 미분 가능성이라는 제약을 수반한다. 최근 공개된 'Dust' 연구는 이러한 역전파 없이도 트랜스포머 모델을 사전 학습할 수 있는 가능성을 제시한다. 이는 '더 많은 연산량을 활용할 수 있다면 범용적이고 무차별적인 학습 알고리즘이 성공한다'는 '쓴 교훈(The bitter lesson)'에 기반한다. 과거 AlphaGo Zero가 인간 데이터 없이 자가 대국(Self-play)만으로 기존 모델을 능가했듯, 역전파 없이도 충분한 연산량을 투입하면 더 효과적인 학습이 가능할 수 있다는 가설이다. 즉, 역전파와 미분 가능성은 저연산 환경에서 유용한 귀납적 편향일 뿐, 대규모 연산 시대에는 다른 접근법이 필요할 수 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Dust: Pretraining Transformers Without Backpropagation
원문 보기 ↗