← promppy_ 실시간 AI 뉴스
참고X

Hy4-preview 양자화 기술 'MIX-STQ1_0' 공개… 성능 저하 최소화 기법

레이어별 비트 레이트를 최적화(1.31~2.06bit)하여 성능 손실을 최소화하는 양자화 기법 공유.

요약

TencentHunyuan은 Hy4-preview 모델을 기존 1.5TB에서 약 200GiB GGUF 포맷으로 압축한 MIX-STQ1_0 버전을 공개했다. 이 압축 기술의 핵심은 캘리브레이션 데이터를 활용하여 레이어별 비트 수를 차등 적용하는 방식으로, 일부는 1.31-bit STQ1_0까지, 다른 일부는 2.06-bit IQ2_XXS까지 최적화했다. 결과적으로 동일한 용량 내에서 오차를 낮추며 성능을 효율적으로 보존했다. BF16 모델과 비교했을 때 MCP Atlas(83.7→83.2), SWE-Bench multi(82.9→81.3) 등 주요 벤치마크에서 성능 저하가 거의 나타나지 않았다. 관련 가중치와 상세 내용은 허깅페이스의 AngelSlim/Hy4-preview-GGUF 저장소에서 확인할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @TencentHunyuan: We compressed Hy4-preview from 1.5TB to ~200GiB GGUF and it still works well ! Meet MIX-STQ1_0.The trick isn’t just going low, it’

원문 보기 ↗
다음 뉴스 →

중요삼성, SEMICON Taiwan서 차세대 'zHBM' 공개…메모리를 프로세서 위에 직접 적층

2029년 목표의 콘셉트 단계지만, 실현 시 HBM 판도 전환 가능. SK하이닉스·엔비디아 공급망 주시 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스