참고팁Reddit
vLLM 환경서 Oh My Pi와 Qwen3.8-27B 구동 시 대기 시간 70% 단축 팁
vLLM 설정 및 prefix cache 활용을 통해 에이전트 대기 시간을 26초에서 7초대로 대폭 개선한 최적화 가이드.
요약
r/LocalLLM 커뮤니티 사용자가 vLLM을 활용해 2개의 RTX 3090 GPU 환경에서 Qwen3.8-27B 모델을 구동하며 'Oh My Pi(omp)' 성능을 최적화한 사례를 공유했다. 초기에는 첫 토큰 생성까지 수 분이 소요되었으나, 불필요한 기본 설정을 수정해 평균 대기 시간을 26-28초에서 7.3초로 단축했다. 또한 접두사 캐시(prefix cache) 적중률을 55%에서 95%까지 개선하여 효율을 크게 높였다. 모든 역할에 명시적인 노력 수준(effort level)을 지정하고 'thinking_token_budget'을 6,000 토큰으로 제한하여 평균 응답 길이를 2,481 토큰에서 867 토큰으로 최적화했다. 마지막으로 에이전트의 파일 작성 중단 문제를 해결하기 위해 'maxTokens' 설정을 32,768로 상향 조정했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Tuning Oh My Pi for Qwen3.8-27B on 2x 3090 with vLLM
원문 보기 ↗