Qwen3.8-27B 로컬 서빙 성능 최적화: vLLM과 NVIDIA CMP 170HX 튜닝
특정 하드웨어에서 vLLM 최적화로 긴 컨텍스트 처리 효율을 극대화한 사례. 온프레미스 서빙 최적화 참고용.
요약
Reddit 사용자가 NVIDIA CMP 170HX 64GB GPU 1개 환경에서 vLLM 0.27.1을 활용해 Qwen3.8-27B 및 DFlash2 모델의 최적화 작업을 완료했다. 테스트 결과 4K 컨텍스트에서 134.7 tok/s, 32K에서 147.0 tok/s의 디코드 속도를 기록했으며, 250K 컨텍스트에서도 64.9 tok/s의 성능을 보였다. 이번 최적화의 핵심은 커스텀 혼합 FP8 추론 검증기(speculative verifier) 도입과 풀 CUDA 그래프 적용이다. 구체적으로는 Qwen3.8-27B W4A16 타겟 모델과 DFlash2 W4A16 드래프터 모델, FP8 타겟 KV 캐시 등을 조합하여 SM80 아키텍처에 맞춘 최적화를 수행했다. 특히 장문 컨텍스트 환경에서 성능 향상이 두드러졌으며, 관련 최적화 코드는 GitHub 저장소를 통해 공개되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-27B at 147 tok/s on one CMP 170HX — 65 tok/s at 250K CTX
원문 보기 ↗