참고팁X
LLM 양자화 핵심 기법 5종 원리 분석
RTN, GPTQ, AWQ, INT8, QAT의 작동 원리 비교. 모델 경량화 및 추론 최적화 시 참고할 가이드.
요약
70B 매개변수 모델은 FP16 환경에서 140GB를 차지하지만 4-bit 양자화를 적용하면 35GB로 줄어들어 단일 GPU 탑재가 가능해진다. 다만 단순 반올림 방식은 전체 텐서 값보다 20배 큰 0.1%의 이상치(outlier) 차원으로 인해 성능 저하가 발생한다. 이를 해결하는 5가지 주요 양자화 기법은 처리 시점에 따라 구분되는데, RTN은 별도 조정 없이 반올림하며, GPTQ는 열 단위로 오차를 보정한다. AWQ는 중요한 1% 채널을 사전에 강화하며, LLM.int8()은 이상치만 FP16으로 유지하고 나머지를 INT8로 처리한다. 마지막으로 QAT는 학습 과정에서 반올림 오차를 반영해 미세 조정하는 방식을 취한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @_avichawla: 5 LLM quantization techniques, clearly explained: (bookmark this) A 70B model in FP16 needs 140GB for weights alone. At 4-bit, tha
원문 보기 ↗