참고팁Reddit
Qwen3.8 27B 로컬 최적화: 5090 환경서 480 tok/s 달성한 QAT 체크포인트 공유
QUASAR QAT 기술과 DFlash2를 활용해 로컬 모델 추론 성능을 극대화한 실전 사례입니다.
요약
최근 Reddit r/LocalLLM 커뮤니티에 Qwen3.8-27B 모델을 NVIDIA GeForce RTX 5090에서 실행한 벤치마크 결과가 공유되었다. 기존 NInfer 공식 양자화 모델 대신 QUASAR의 QAT full-NVFP4 체크포인트와 DFlash2 기술을 적용한 결과, JSON 출력 기준 초당 484 토큰(tok/s)의 속도를 기록하며 기존의 400 tok/s 대비 성능이 향상되었다. 또한 동일한 하드웨어 환경에서 VRAM 사용량은 30.8GB에서 27.0GB로 약 3.8GB 절감되었으며, 실제 에이전트 작업에서도 33k 토큰 평균 287 tok/s의 속도를 보였다. 퍼플렉서티(Perplexity) 성능은 약 1.9% 저하되었으나 실제 사용 시 체감되는 수준은 아닌 것으로 평가된다. 해당 모델은 Hugging Face를 통해 공개되었으며, NInfer 엔진 환경에서 테스트되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8 27B runs at ~480 tok/s on a single 5090
원문 보기 ↗