참고팁Reddit
16GB Mac에서 로컬 LLM 2종 동시 구동 시 메모리 병목 분석
ollama ps 수치와 실제 VRAM 점유량 차이 측정. 로컬 에이전트 설계 시 스케줄링 전략 참고.
요약
한 개발자가 9월 첫째 주 16GB M1 Pro 맥에서 Ollama를 활용해 개인 비서를 구축하며 겪은 기술적 인사이트를 공유했다. Ollama ps 명령어로 확인한 모델 크기와 달리, 실제로는 임베딩 테이블 등 보이지 않는 메모리 점유로 인해 gemma4:latest와 gemma4:12b 모델을 동시에 메모리에 상주시키는 것이 불가능했다. Ollama 스케줄러가 예측한 메모리 점유량은 약 10.6GiB였으며, 두 모델을 전환할 때마다 4~7초의 콜드 로드(cold load) 지연이 발생했다. 이러한 메모리 병목 현상으로 인해 기존의 두 모델 기반 라우팅 설계 전략을 수정해야 했다. 이번 사례는 로컬 LLM 환경 구축 시 단순 명령어 확인치 이상의 실제 메모리 리소스 할당에 대한 면밀한 고려가 필요함을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Six days building a local assistant on a 16 GB Mac. The numbers that changed my design.
원문 보기 ↗