M4 Max 맥북 프로에서 Qwen 3.6 로컬 구동 후기
최신 애플 실리콘 환경에서의 로컬 LLM 성능 및 발열/전력 소비 확인 가능. 오프라인 개발 환경 구축 시 참고.
요약
X 사용자 @freddier가 M4 Max 칩과 36GB RAM을 탑재한 맥북프로에서 오프라인으로 거대언어모델(LLM)을 구동한 사례를 공유했다. 해당 환경에서 heavily quantized 된 Qwen3.6 모델을 LMStudio로 실행할 경우 초당 8~12 토큰의 생성 속도를 보여준다. 컨텍스트 윈도우는 약 4,000 토큰으로 제한적이지만, 인터넷 연결 없이도 간단한 과학·기술 질문이나 문법 교정 등 보조 도구로 활용하기에 적합하다. 모델 가중치를 HuggingFace에서 다운로드하여 설치하는 것만으로 20GB 용량 내에서 모든 지식 데이터에 접근할 수 있다. 다만, 로컬 구동 시 배터리 소모가 매우 크다는 점은 실무적인 고려 사항이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @freddier: I run an LLM offline on my laptop. A heavily quantized Qwen3.6, using LMStudio. MBP M4 Max 36GB RAM. It does 8-12 tokens per secon
원문 보기 ↗