vLLM의 C++20 포팅 'vllm.cpp' 공개: Python 의존성 없는 추론 환경 구축
Python 실행 환경 없이 C++ 바이너리만으로 경량 추론 서버를 배포하고 싶을 때 유용한 대안.
요약
한 개발자가 vLLM의 서빙 스택을 C++20으로 재구현한 'vllm.cpp'를 공개했다. 기존 vLLM은 설치 시 9.1 GiB의 용량을 차지하고 파이썬 의존성 문제가 있었으나, 이 프로젝트는 66 MiB 크기의 바이너리 파일로 구동되어 배포 및 임베딩이 훨씬 효율적이다. vllm.cpp는 원본 vLLM의 핵심 기능인 연속 배치(Continuous batching), 블록 페이지 KV, 자동 프리픽스 캐싱, 추측 디코딩 등을 그대로 지원한다. 또한 OpenAI와 호환되는 서버를 제공하며, 출력 결과 역시 원본 vLLM과 토큰 단위로 동일함을 검증했다. 파이썬 인터프리터 없이 추론 환경을 구축하고자 하는 실무자들에게 유용한 대안이 될 것으로 보인다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I ported vLLM's serving stack to C++20: 66 MiB binary, no Python at inference, output checked token-for-token against vLLM
원문 보기 ↗