Qwen3.8-27B 로컬 구동 벤치마크: RTX 3090 2장 환경에서 218 tok/s 달성
DFlash2와 vLLM 최적화로 로컬에서 고성능 추론이 가능함을 입증한 구체적인 셋업 사례.
요약
Reddit의 r/LocalLLaMA 커뮤니티에서 RTX 3090 2대를 활용해 Qwen3.8-27B 모델을 구동한 실험 결과가 공유되었다. vLLM v0.26.1rc1 버전에 DFlash2 드래프트 모델과 AutoRound INT4 양자화를 적용한 결과, 단일 요청 기준 초당 218.3 토큰(tok/s)의 디코드 속도를 기록했다. 프리필(Prefill) 성능은 10k 컨텍스트에서 1342 tok/s, 90k에서 628 tok/s를 보였으며 최대 컨텍스트 길이는 131k까지 확장 가능했다. 이번 실험은 NVLink가 없는 환경에서 PCIe Gen4 x16/x16 연결을 통해 진행되었으며, 카드당 피크 VRAM 사용량은 22.3GB로 측정되었다. 원작자는 실험을 위해 Kimi K3를 활용한 vLLM 패치 적용 및 전력 제한(220/250W) 설정을 병행했다고 밝혔다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-27B on 2x 3090 + vLLM + DFlash2: 218 tok/s single request
원문 보기 ↗