← promppy_ 실시간 AI 뉴스
참고Reddit

vLLM의 C++20 포팅 'vllm.cpp' 공개: Python 의존성 없는 추론 환경 구축

Python 실행 환경 없이 C++ 바이너리만으로 경량 추론 서버를 배포하고 싶을 때 유용한 대안.

요약

한 개발자가 vLLM의 서빙 스택을 C++20으로 재구현한 'vllm.cpp'를 공개했다. 기존 vLLM은 설치 시 9.1 GiB의 용량을 차지하고 파이썬 의존성 문제가 있었으나, 이 프로젝트는 66 MiB 크기의 바이너리 파일로 구동되어 배포 및 임베딩이 훨씬 효율적이다. vllm.cpp는 원본 vLLM의 핵심 기능인 연속 배치(Continuous batching), 블록 페이지 KV, 자동 프리픽스 캐싱, 추측 디코딩 등을 그대로 지원한다. 또한 OpenAI와 호환되는 서버를 제공하며, 출력 결과 역시 원본 vLLM과 토큰 단위로 동일함을 검증했다. 파이썬 인터프리터 없이 추론 환경을 구축하고자 하는 실무자들에게 유용한 대안이 될 것으로 보인다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I ported vLLM's serving stack to C++20: 66 MiB binary, no Python at inference, output checked token-for-token against vLLM

원문 보기 ↗
다음 뉴스 →

중요Cursor, 스킬·MCP 서버를 묶는 오픈 표준 'Agent Plugins' 지원

에이전트마다 따로 설정하던 스킬·MCP를 하나로 번들링해 재사용 가능. 표준 채택 여부 주목.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스