Qwen3.8-27B용 NVFP4 완전 양자화 체크포인트 공개
QUASAR 알고리즘으로 W4A4 양자화된 Qwen 모델로, vLLM을 통한 Blackwell GPU 구동 지원.
요약
최근 Reddit의 LocalLLaMA 커뮤니티에 'Qwen3.8-27B' 모델을 NVFP4로 완전 양자화한 버전이 공개되었습니다. 이번 체크포인트는 QUASAR라는 새로운 QAT 알고리즘을 사용한 'Quantization-Aware Distillation(QAD)' 방식을 적용했으며, 원본 BF16 모델을 티처 모델로 삼아 2,446단계의 증류 과정을 거쳤습니다. 해당 모델은 NVIDIA Blackwell GPU 환경의 vLLM을 공식 지원합니다. 특히 모든 트랜스포머 블록 내 선형 레이어를 W4A4(NVFP4)로 양자화하는 공격적인 설정을 적용했습니다. 기존에는 성능 저하를 방지하기 위해 Attention 및 GDN 레이어를 FP8이나 BF16으로 유지했으나, QUASAR 기술을 통해 이러한 완전 양자화 상태에서도 BF16에 근접한 성능을 유지합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Fully quantized NVFP4 Qwen3.8-27B with QUASAR QAD
원문 보기 ↗