참고팁Reddit
llama.cpp CPU 추론 성능 3배 이상 향상 (PR #26348)
x86 환경 Q2_0 양자화 모델 추론 속도가 크게 개선됨. 로컬 LLM 최적화 시 참고.
요약
llama.cpp의 최신 풀 리퀘스트(#26348)를 통해 Q2_0 × Q8_0 내적 연산에서 x86 VNNI 구현이 추가되어 x86 CPU 환경의 추론 속도가 3.0~3.6배 향상되었습니다. AMD EPYC 9645 CPU 환경에서 1.7B부터 27B 파라미터 규모의 Bonsai 모델을 대상으로 성능을 측정한 결과, 대부분의 모델에서 3배 이상의 처리량(throughput) 개선이 확인되었습니다. 특히 8B 모델의 경우 tg128 기준 추론 속도가 초당 2.39 토큰에서 8.20 토큰으로 약 3.43배 빨라졌습니다. 이번 최적화는 별도의 가속기 없이 CPU 환경에서 LLM을 구동하는 실무자들에게 유의미한 성능 향상을 제공할 것으로 기대됩니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 A llama.cpp PR makes Q2_0 3.0–3.6x faster on x86 CPUs, 8B decode goes 2.39 → 8.20 tok/s
원문 보기 ↗