← promppy_ 실시간 AI 뉴스
참고Reddit

GGUF 양자화 모델 검증 결과: 14% 파일이 표기된 비트 수와 실제 정밀도 일치하지 않아

K-quant 양자화 시 tensor 차원 문제로 자동 치환되는 현상 발생. 저비트 모델 사용 시 실제 비트레이트 확인 필요.

요약

최근 Reddit의 r/LocalLLaMA 커뮤니티에서 진행된 GGUF 양자화 모델 감사 결과, 25개 저장소 내 443개 파일 중 64개가 파일명과 실제 양자화 수준이 일치하지 않는 것으로 나타났다. 이는 K-quants 및 I-quants 방식이 텐서 행을 256으로 나눌 수 있어야 한다는 제약 조건 때문인데, 조건에 부합하지 않을 경우 llama-quantize 도구가 자동으로 약 4.5 bpw 수준의 다른 양자화 유형으로 대체하기 때문이다. 예를 들어 Nemotron-3.5-Lightning 모델의 경우, 서로 다른 이름의 4개 IQ2 파일이 실제로는 모두 동일한 4.58 bpw 파일로 확인되었다. 따라서 사용자가 요청한 저비트 양자화 파일이 실제로는 더 높은 비트의 파일일 가능성이 존재한다. 작성자는 이번 감사를 통해 사용자들이 파일명만으로 정확한 양자화 정보를 판단하기 어렵다는 점을 지적하며, 관련 도구와 전체 조사 데이터를 공개했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I audited 443 GGUF quants across 25 repos. 64 of them can't be the quant their filename claims.

원문 보기 ↗
다음 뉴스 →

중요美, 中 기업의 '원격 연산' 우회 차단 규제 검토…AI 인프라 수출 통제 강화

대규모 클라우드 연산 접근 제한이 가시화됨. AI 서비스의 인프라 공급망과 비용 리스크 점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스