Hy4-preview 양자화 기술 'MIX-STQ1_0' 공개… 성능 저하 최소화 기법
레이어별 비트 레이트를 최적화(1.31~2.06bit)하여 성능 손실을 최소화하는 양자화 기법 공유.
요약
TencentHunyuan은 Hy4-preview 모델을 기존 1.5TB에서 약 200GiB GGUF 포맷으로 압축한 MIX-STQ1_0 버전을 공개했다. 이 압축 기술의 핵심은 캘리브레이션 데이터를 활용하여 레이어별 비트 수를 차등 적용하는 방식으로, 일부는 1.31-bit STQ1_0까지, 다른 일부는 2.06-bit IQ2_XXS까지 최적화했다. 결과적으로 동일한 용량 내에서 오차를 낮추며 성능을 효율적으로 보존했다. BF16 모델과 비교했을 때 MCP Atlas(83.7→83.2), SWE-Bench multi(82.9→81.3) 등 주요 벤치마크에서 성능 저하가 거의 나타나지 않았다. 관련 가중치와 상세 내용은 허깅페이스의 AngelSlim/Hy4-preview-GGUF 저장소에서 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @TencentHunyuan: We compressed Hy4-preview from 1.5TB to ~200GiB GGUF and it still works well ! Meet MIX-STQ1_0.The trick isn’t just going low, it’
원문 보기 ↗