← promppy_ 실시간 AI 뉴스
참고Reddit

Qwen3.8-27B 로컬 서빙 성능 최적화: vLLM과 NVIDIA CMP 170HX 튜닝

특정 하드웨어에서 vLLM 최적화로 긴 컨텍스트 처리 효율을 극대화한 사례. 온프레미스 서빙 최적화 참고용.

요약

Reddit 사용자가 NVIDIA CMP 170HX 64GB GPU 1개 환경에서 vLLM 0.27.1을 활용해 Qwen3.8-27B 및 DFlash2 모델의 최적화 작업을 완료했다. 테스트 결과 4K 컨텍스트에서 134.7 tok/s, 32K에서 147.0 tok/s의 디코드 속도를 기록했으며, 250K 컨텍스트에서도 64.9 tok/s의 성능을 보였다. 이번 최적화의 핵심은 커스텀 혼합 FP8 추론 검증기(speculative verifier) 도입과 풀 CUDA 그래프 적용이다. 구체적으로는 Qwen3.8-27B W4A16 타겟 모델과 DFlash2 W4A16 드래프터 모델, FP8 타겟 KV 캐시 등을 조합하여 SM80 아키텍처에 맞춘 최적화를 수행했다. 특히 장문 컨텍스트 환경에서 성능 향상이 두드러졌으며, 관련 최적화 코드는 GitHub 저장소를 통해 공개되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3.8-27B at 147 tok/s on one CMP 170HX — 65 tok/s at 250K CTX

원문 보기 ↗

광고

다음 뉴스 →

중요Anthropic, 자체 습식 연구소 설립…시뮬레이션 넘어 실제 실험 진출

Claude가 로봇 장비를 제어해 실험 자동화 검증. 바이오·과학 R&D의 AI 에이전트화 흐름 주목.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스