← promppy_ 실시간 AI 뉴스
참고Reddit

DeepSeek-V4-Flash-0731 전문가 전용 IQ3 양자화 버전 공개

전문가 파라미터만 IQ3로 재양자화해 VRAM 효율성 개선. 4-bit 이상 유지가 어려운 환경에서 유효한 대안.

요약

Reddit의 r/LocalLLaMA 커뮤니티에 DeepSeek-V4-Flash-0731 모델의 전문가(Expert) 계층만을 3비트 양자화한 모델이 공개되었습니다. 이번 양자화는 혼합 멀티 GPU 환경에서 모델이 RAM으로 스필오버(Spill)될 때 Q2로 성능을 낮추지 않고 3비트 수준을 유지하려는 사용자들을 위해 제작되었습니다. 전체 129개의 라우팅 전문가 텐서만 IQ3_XXS와 IQ3_S로 압축하고, 나머지 어텐션과 공유 전문가 텐서 등은 기존 MXFP4 변환 모델의 정밀도를 유지했습니다. 결과물은 4개의 샤드로 구성된 111.37GiB 크기로, calibration_datav3를 사용해 imatrix를 구축했습니다. 벤치마크 결과, 기존 UD-IQ3_S 모델 대비 더 나은 KLD(Kullback-Leibler Divergence) 점수를 기록했으며 CPU 스필 장비에서 1.4배 빠른 디코딩 속도를 보입니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Expert-only IQ3 requant of DeepSeek-V4-Flash-0731: better KLD than UD-IQ3_S, 1.4x decode on a CPU-spill rig

원문 보기 ↗
다음 뉴스 →

중요미네소타 'AI 누드 이미지 금지법' 발효...법원, xAI 가처분 기각

미국 최초 nudify 규제 발효. 이미지 생성 모델 서비스라면 지역별 컴플라이언스 점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

최신 뉴스