단일 노드 멀티 모델 서빙 시 GPU 메모리 최적화 전략
여러 모델 동시 구동 시 고정 메모리 점유가 비효율적. 에이전트 루프 내 모델별 메모리 해제 전략으로 효율 개선 가능.
요약
LLM과 보조 모델(음성 인식, 합성, OCR 등)을 함께 사용하는 멀티 모델 파이프라인에서 정적 리소스 할당은 비효율적인 메모리 점유를 유발한다. 단일 개발 환경에서 Qwen3.8-27B(FP8)를 Nemotron, Chatterbox, Unlimited-OCR과 동시에 실행했을 때, 요청 처리 전에도 약 122GB의 GPU 메모리가 유휴 상태로 소모되었다. 이러한 과도한 메모리 점유는 주로 SGLang의 KV 캐시 및 실행 스크래치패드 사전 할당과 보조 런타임의 정적 버퍼 유지로 인해 발생한다. 단일 테넌트나 순차적 에이전트 작업에서는 오디오 및 비전 모델이 상호 배타적으로 작동하므로, 모든 모델의 최대 할당량을 동시에 유지할 필요가 없다. 따라서 에이전트 워크플로우에 맞춰 메모리를 동적으로 관리함으로써 리소스 효율성을 개선해야 한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Multi-model serving on a single node: idle memory management and sub-200ms warmups
원문 보기 ↗