[논문] ToMoE: 밀집형 LLM을 MoE 구조로 변환하는 동적 가지치기 기법
모델 경량화 및 추론 효율 개선 연구. 최신 최적화 방법론으로 주목.
요약
최근 Reddit r/LocalLLaMA 커뮤니티에서 주목받는 논문 'ToMoE: Converting Dense Large Language Models to Mixture-of-Experts through Dynamic Structural Pruning'이 공개되었다. 이 연구는 거대언어모델(LLM)의 높은 연산 및 메모리 비용을 해결하기 위해 기존의 영구적인 가지치기(Pruning) 방식 대신 동적 구조적 가지치기 기법을 제안한다. 핵심은 모델 파라미터를 영구적으로 삭제하는 대신, 활성 파라미터 수를 줄이는 방식을 통해 성능 저하 문제를 완화하는 것이다. 연구진은 미분 가능한 동적 가지치기 방식을 도입하여 조밀한(Dense) 모델을 Mixture-of-Experts(MoE) 구조로 효율적으로 전환하는 데 성공했다. 이를 통해 자원이 제한된 환경에서도 LLM의 배포 및 서비스 효율성을 크게 높일 수 있을 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 [Paper] ToMoE: Converting Dense Large Language Models to Mixture-of-Experts through Dynamic Structural Pruning
원문 보기 ↗