참고팁Reddit
로컬 LLM 'POCKET-35B' 출시, CPU 및 스마트폰 구동 지원
GPU 없이 CPU/RAM만으로 35B 모델을 모바일 및 일반 PC에서 구동 가능. 경량화 및 추론 최적화 참고용.
요약
Reddit r/LocalLLaMA 커뮤니티에서 별도의 GPU 없이 CPU 기반으로 구동 가능한 35B 파라미터 규모의 에이전트 모델 'POCKET-35B'가 공개되어 화제다. 이 모델은 llama.cpp 환경에서 CUDA 없이 순수 CPU 구동이 가능하며, 양자화 버전에 따라 일반 PC부터 스마트폰까지 다양한 기기에서 최적화된 성능을 제공한다. 가장 고품질인 Q4_K_M 버전은 21GB 크기로 32GB RAM PC에서 구동 가능하며, 13GB 크기의 Q2_K 버전은 미니 PC에서 구동할 수 있다. 특히 한국어 최적화 모델인 POCKET-KR-GGUF(5.1GB)는 8GB 이상의 RAM을 탑재한 안드로이드 기기에서, POCKET-KR-MLX(5.1GB)는 Apple 기기에서 구동 가능하다. 일반적인 환경에서도 준수한 성능을 보여주어 온디바이스 AI 구동 효율성을 극대화한 것이 핵심이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 POCKET-35B agentic model on cpu 59 t/s
원문 보기 ↗