Ollama에서 다중 모델 로드 시 VRAM 해제 이슈 대응책
멀티 모델 환경에서 모델이 강제 언로드되는 문제의 원인과 로컬 서버 운영 시 자원 할당 최적화 팁을 얻을 수 있습니다.
요약
Reddit의 r/ollama 커뮤니티에서 Ollama 사용자가 다중 모델 동시 로딩 시 발생하는 문제에 대해 문제를 제기했습니다. 해당 사용자는 리눅스 서버 환경에서 12GB VRAM을 활용해 12BQ4와 7BQ4 모델을 동시에 구동하고자 환경 변수 'OLLAMA_NUM_PARALLEL=2'와 'OLLAMA_MAX_LOADED_MODELS=2'를 설정했습니다. 하지만 의도와 달리 첫 번째 모델이 로드된 후 두 번째 모델을 호출하면, 기존 모델이 VRAM에서 즉시 언로드되는 현상이 발생했습니다. 사용자는 NVTOP으로 GPU 활동을 모니터링한 결과, 두 번째 모델 로드 시 첫 번째 모델의 VRAM 점유율이 0으로 급감하는 것을 확인했습니다. Ollama가 효율적인 동시 로딩 대신 모델을 강제로 교체하며 메모리를 관리하는 문제로 보여, 실무 환경에서 다중 모델 운영 시 주의가 필요합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Ollama forcefully unload models instead of load concurrent models in RAM
원문 보기 ↗