Qwen3.8-Flash-Next (180B), DGX Spark에서 43.9 tok/s 성능 기록
180B 모델임에도 27B dense 대비 4배 속도 달성. 로컬 환경 최적화 및 추론 성능 벤치마크 참고.
요약
최신 벤치마크 결과, 180B 파라미터를 가진 Qwen3.8-Flash-Next 모델이 단일 DGX Spark 환경에서 43.9 tok/s의 추론 속도를 기록했습니다. 이는 동일 환경에서 27B dense 모델인 Qwen3.8-27B(11.2 tok/s)보다 4배 빠른 성능입니다. Qwen3.8-Flash-Next는 토큰당 7.31B 파라미터를 활성화하고 내장된 draft head를 통한 speculative decoding을 활용합니다. 테스트는 vLLM 서버, FP8 KV 캐시, MTP depth 3 설정의 GB10 Blackwell 하드웨어 환경에서 진행되었습니다. 해당 모델은 123.53 GiB의 텐서 데이터를 보유하며 121.7 GiB의 메모리 환경에서 구동되었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-Flash-Next (180B MoE) on one DGX Spark: 43.9 tok/s. The same machine gave 11.2 tok/s with Qwen3.8-27B dense model.
원문 보기 ↗