Qwen3.8 모델 벤치마크: DFlash2 기반 로컬 추론 성능 테스트
SGLang/vLLM 환경에서 Qwen3.8 변종별 레이턴시와 성능을 비교한 실측 데이터로, 로컬 인프라 구축 시 참고.
요약
최근 Reddit의 LocalLLaMA 커뮤니티에서 Qwen3.8 기반의 세 가지 모델(RadixArk 27B NVFP4, orcarouter 27B Uncensored, RadixArk Flash-Next NVFP4)을 RTX PRO 6000 환경에서 테스트한 결과가 공개되었습니다. 테스트 결과 Flash-Next 모델이 5개 항목에서 승리하며 27B 모델(4승)보다 우수한 성능을 보였고, 모든 모델이 긴 문맥 회상(Long-context recall)에서 100% 정확도를 기록했습니다. Prefill 속도 측면에서는 Flash-Next가 22.4초로, 27B(97초)와 Uncensored(99초) 모델 대비 압도적인 성능을 나타냈습니다. 또한 DFlash2 drafter를 활용한 추측 디코딩(Speculative decoding)을 27B 모델에 적용했을 때, Spec-Bench 점수가 75에서 210으로 크게 향상되었습니다. 이번 테스트는 로컬 환경에서 SGLang 및 vLLM 레시피를 최적화하여 모델 성능을 극대화하려는 사용자들에게 유용한 데이터를 제공합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I spent 3 weeks testing local Qwen3.8 on the new low-latency SGLang/vLLM recipes: DFlash2 2.8x. Builds: RadixArk + Inferact 27B NVFP4, 27B BF16, orcarouter 27B Uncensored, Flash-Next NVFP4
원문 보기 ↗