DeepSeek-V4-Flash-0731 전문가 전용 IQ3 양자화 버전 공개
전문가 파라미터만 IQ3로 재양자화해 VRAM 효율성 개선. 4-bit 이상 유지가 어려운 환경에서 유효한 대안.
요약
Reddit의 r/LocalLLaMA 커뮤니티에 DeepSeek-V4-Flash-0731 모델의 전문가(Expert) 계층만을 3비트 양자화한 모델이 공개되었습니다. 이번 양자화는 혼합 멀티 GPU 환경에서 모델이 RAM으로 스필오버(Spill)될 때 Q2로 성능을 낮추지 않고 3비트 수준을 유지하려는 사용자들을 위해 제작되었습니다. 전체 129개의 라우팅 전문가 텐서만 IQ3_XXS와 IQ3_S로 압축하고, 나머지 어텐션과 공유 전문가 텐서 등은 기존 MXFP4 변환 모델의 정밀도를 유지했습니다. 결과물은 4개의 샤드로 구성된 111.37GiB 크기로, calibration_datav3를 사용해 imatrix를 구축했습니다. 벤치마크 결과, 기존 UD-IQ3_S 모델 대비 더 나은 KLD(Kullback-Leibler Divergence) 점수를 기록했으며 CPU 스필 장비에서 1.4배 빠른 디코딩 속도를 보입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Expert-only IQ3 requant of DeepSeek-V4-Flash-0731: better KLD than UD-IQ3_S, 1.4x decode on a CPU-spill rig
원문 보기 ↗