vLLM, 멀티 모델 서빙 기능 거부…대안으로 SIE 인퍼런스 서버 주목
하나의 GPU에 여러 소형 모델을 띄워 추론 효율을 높이는 실용적 아키텍처와 도구(SIE) 공유.
요약
vLLM이 단일 GPU에서 여러 소형 모델을 구동하는 기능 요청을 '계획 없음'으로 종결한 것에 대해 개발자들의 비판이 제기되었다. 현재는 모델마다 개별 vLLM 인스턴스를 실행하고 라우팅 계층을 추가해야 하는 번거로움이 있어, 프로세스·메모리 관리의 비효율성이 발생한다. 이에 대한 대안으로 소개된 'SIE(Single Inference Server)'는 여러 모델을 하나의 추론 서버에서 관리하며, 온디맨드 로딩과 LRU 방식의 모델 교체를 지원한다. 실제로 SIE를 통해 임베더, 리랭커, 엔티티 추출기, 생성기 등 4개 모델을 단일 GPU에서 구동한 결과, 기존 대비 추론 속도가 18.58초에서 1.47초로 크게 개선되었다. 다중 모델 에이전트 파이프라인 환경에서 모델별 개별 프로세스 운영이 비효율적이라는 지적이 이번 사례의 핵심이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @_avichawla: Strange that vLLM closed this feature request as “not planned”: Devs have requested running several small models on one GPU throug
원문 보기 ↗