GGUF 양자화 모델 검증 결과: 14% 파일이 표기된 비트 수와 실제 정밀도 일치하지 않아
K-quant 양자화 시 tensor 차원 문제로 자동 치환되는 현상 발생. 저비트 모델 사용 시 실제 비트레이트 확인 필요.
요약
최근 Reddit의 r/LocalLLaMA 커뮤니티에서 진행된 GGUF 양자화 모델 감사 결과, 25개 저장소 내 443개 파일 중 64개가 파일명과 실제 양자화 수준이 일치하지 않는 것으로 나타났다. 이는 K-quants 및 I-quants 방식이 텐서 행을 256으로 나눌 수 있어야 한다는 제약 조건 때문인데, 조건에 부합하지 않을 경우 llama-quantize 도구가 자동으로 약 4.5 bpw 수준의 다른 양자화 유형으로 대체하기 때문이다. 예를 들어 Nemotron-3.5-Lightning 모델의 경우, 서로 다른 이름의 4개 IQ2 파일이 실제로는 모두 동일한 4.58 bpw 파일로 확인되었다. 따라서 사용자가 요청한 저비트 양자화 파일이 실제로는 더 높은 비트의 파일일 가능성이 존재한다. 작성자는 이번 감사를 통해 사용자들이 파일명만으로 정확한 양자화 정보를 판단하기 어렵다는 점을 지적하며, 관련 도구와 전체 조사 데이터를 공개했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I audited 443 GGUF quants across 25 repos. 64 of them can't be the quant their filename claims.
원문 보기 ↗