← promppy_ 실시간 AI 뉴스
참고Reddit

llama.cpp CPU 추론 성능 3배 이상 향상 (PR #26348)

x86 환경 Q2_0 양자화 모델 추론 속도가 크게 개선됨. 로컬 LLM 최적화 시 참고.

요약

llama.cpp의 최신 풀 리퀘스트(#26348)를 통해 Q2_0 × Q8_0 내적 연산에서 x86 VNNI 구현이 추가되어 x86 CPU 환경의 추론 속도가 3.0~3.6배 향상되었습니다. AMD EPYC 9645 CPU 환경에서 1.7B부터 27B 파라미터 규모의 Bonsai 모델을 대상으로 성능을 측정한 결과, 대부분의 모델에서 3배 이상의 처리량(throughput) 개선이 확인되었습니다. 특히 8B 모델의 경우 tg128 기준 추론 속도가 초당 2.39 토큰에서 8.20 토큰으로 약 3.43배 빨라졌습니다. 이번 최적화는 별도의 가속기 없이 CPU 환경에서 LLM을 구동하는 실무자들에게 유의미한 성능 향상을 제공할 것으로 기대됩니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 A llama.cpp PR makes Q2_0 3.0–3.6x faster on x86 CPUs, 8B decode goes 2.39 → 8.20 tok/s

원문 보기 ↗
다음 뉴스 →

중요앤트로픽, Claude 안전 분류기 고도화… 생물학 질문 오탐 답변 거부 85% 감소

정상 요청을 위험으로 오판해 막던 문제 완화. 연구·의료·교육 도메인 활용도 재검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스