참고Reddit
텐센트, 770B 파라미터 모델을 214 GiB로 압축하는 양자화 기술 공개
초거대 모델을 소비자용 GPU 환경에서 구동하기 위한 효율적인 압축 및 양자화 기법 상세 분석.
요약
텐센트 훈위안(Tencent Hunyuan)의 양자화 팀은 770B 파라미터 규모의 'Hy4 Preview' 모델을 기존 약 1.5TB에서 214 GiB로 압축하는 데 성공했다. 이번 기술의 핵심은 가중치 표현 방식을 변경하여 파라미터 수는 그대로 유지하면서 데이터 용량을 대폭 줄인 것이다. 'Sherry' 알고리즘과 'STQ1_0' 저장 형식을 활용하여, 4개의 가중치를 5비트로 인코딩하는 방식을 적용해 가중치당 1.25비트 수준으로 효율화했다. 여기에 256개 가중치마다 FP16 스케일을 공유하는 방식을 더해 최종적으로 가중치당 1.3125비트의 압축률을 달성했다. 이번 성과는 대규모 언어 모델의 추론 효율성과 하드웨어 요구 사항을 최적화하려는 실무적 접근을 보여준다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Tencent Packs Open Source 770B-Parameter Hy4 Preview into 214 GiB
원문 보기 ↗