← promppy_ 실시간 AI 뉴스
참고Reddit

ExLlamav3 업데이트: CPU 오프로드 및 Qwen3.8-Flash 지원 추가

로컬 LLM 추론 속도 및 하드웨어 효율 개선. NVIDIA GPU 사용자라면 최신 버전 업데이트 권장.

요약

ExLlamaV3에 MoE(Mixture of Experts) 모델의 CPU 오프로드 기능이 새롭게 추가되는 등 대규모 업데이트가 진행되었다. 이번 업데이트를 통해 Qwen-3.8-Flash-Next의 n-gram 디스크 오프로드와 GLM-5.3-Flash 모델에 대한 지원이 강화되었다. 또한, 새로운 자기 보정(self-calibrated) 최적화 기술이 도입되어 모델 추론 성능이 향상되었다. 이 외에도 다양한 최적화와 개선 사항이 반영되어 전반적인 운영 효율성이 높아졌다. NVIDIA GPU 사용자는 최신 버전의 ExLlamaV3를 통해 개선된 모델 구동 환경을 경험할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 ExLlamav3 Recent Updates : CPU offload, GLM-5.3-FLASH, Qwen3.8-Flash, SC Quants ++

원문 보기 ↗
다음 뉴스 →

중요Anthropic, 수만 곡 무단 학습 혐의로 수십억 달러 저작권 소송 피소

학습 데이터 저작권 리스크 재부각. 국내 서비스도 데이터 출처·라이선스 점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스