← promppy_ 실시간 AI 뉴스
참고HF Blog

LFM2.5 QAD 양자화 체크포인트 공개: 로컬 추론 최적화 데이터

양자화 인식 증류(QAD)를 통해 로컬 모델의 성능 저하 없이 추론 속도를 4~33% 향상시킨 기술 보고서입니다.

요약

Hugging Face는 양자화 인식 증류(QAD) 기술을 적용한 LFM2.5 모델 4종(230M, 350M, 1.2B-Instruct, 2.6B)의 Q4_0 체크포인트를 공개했다. 기존의 사후 양자화(PTQ) 방식과 비교했을 때, QAD 체크포인트는 BF16 베이스라인 성능의 96.5~97.4% 수준을 유지하며 모든 모델에서 성능 향상을 보였다. 230M과 350M 모델은 Q5_K_M 품질과 동등하면서도 디코드 처리량이 4~33% 높았으며, 1.2B와 2.6B 모델은 Q4_K_M 품질과 동등한 상태에서 처리량이 3~14% 향상되었다. 성능 평가에는 GPQA Diamond, MMLU-Pro, IFEval 등 다양한 벤치마크가 사용되었으며, MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra, Raspberry Pi 5 환경에서 추론 속도가 측정되었다. 해당 체크포인트는 llama.cpp를 비롯한 모든 GGUF 지원 런타임에서 즉시 사용 가능하다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 LFM2.5 Q4\_0 Checkpoints from Quantization-Aware Distillation

원문 보기 ↗
다음 뉴스 →

중요Cerebras, GPU 대비 추론 30배 빠른 랙 규모 시스템 'CS-4' 공개

WSE-3 Turbo 3개로 와트당 처리량 10배. 대규모 추론 인프라 GPU 대안 검토 여지.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스