Qwen3.8-27B 로컬 구동 벤치마크: RTX 5090 환경서 200 tok/s 달성
고성능 하드웨어 환경에서 최적화 엔진을 통해 로컬 LLM의 추론 성능을 어디까지 끌어올릴 수 있는지 보여주는 사례입니다.
요약
최근 Reddit의 r/LocalLLM 커뮤니티에서 RTX 5090(32GB) GPU와 NInfer 엔진을 활용한 Qwen3.8-27B(NVFP4) 모델 구동 사례가 주목받고 있다. 해당 환경은 Windows 11과 WSL2(Ubuntu) 기반으로 설정되었으며, Qwen3.8-27B Huihui abliterated 모델을 NVFP4 양자화 방식으로 실행한다. NInfer 엔진은 KV 캐시를 fp8로 처리하고 MTP(Speculative Decoding)를 적용하여 192K 컨텍스트를 지원하며, 코딩 작업에서 약 205 tok/s의 생성 속도를 달성했다. 프리필(Prefill) 성능 측정 결과, 8K 컨텍스트에서 약 9,000 tok/s, 64K에서는 약 6,200 tok/s, 128K에서는 약 4,500 tok/s의 높은 처리량을 보였다. 이번 테스트는 로컬 환경에서도 고성능 GPU와 최적화된 엔진을 통해 대규모 컨텍스트를 효율적으로 활용할 수 있음을 입증했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-27B NVFP4 5090 via NInfer on Windows/WSL2 - 205 tok/s coding, ~9k prefill, 192K ctx
원문 보기 ↗