참고팁Reddit
Ollama(올라마) 멀티 GPU 환경 구성 및 가속기 할당 문제 해결 가이드
리눅스 환경에서 AMD와 NVIDIA(엔비디아) GPU를 혼용하여 Ollama(올라마) 인스턴스를 분리 구동할 때의 설정 노하우 공유.
요약
한 Reddit 사용자가 전기 요금 절감과 공간 효율화를 위해 두 대의 컴퓨터를 하나의 시스템으로 통합하고 두 개의 GPU를 장착했습니다. 메인 Nvidia GPU는 Gen3 X16 슬롯에, AMD GPU는 Gen 1 X4 슬롯에 연결하여 각각 리눅스 환경에서 인식시켰습니다. 사용자는 Ollama 인스턴스를 포트 11434와 11435로 나누어 실행하며 CUDA_VISIBLE_DEVICES=0과 ROCR_VISIBLE_DEVICES=0 환경 변수를 각각 설정했습니다. 그러나 설정에도 불구하고 두 인스턴스가 독립적으로 작동하지 않고 특정 카드에 모델이 몰리는 현상이 발생해 해결책을 찾고 있습니다. 실무 환경에서 다중 GPU 설정 시 환경 변수 설정만으로는 작업 분산이 원활하지 않을 수 있음을 보여주는 사례입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 New challenge: consolidated 2 cards in a single system but one card hogs all the models even if I run 2 different instances of Ollama on 2 different ports
원문 보기 ↗