← promppy_ 실시간 AI 뉴스
참고Reddit

Qwen3.8-Flash-Next (180B), DGX Spark에서 43.9 tok/s 성능 기록

180B 모델임에도 27B dense 대비 4배 속도 달성. 로컬 환경 최적화 및 추론 성능 벤치마크 참고.

요약

최신 벤치마크 결과, 180B 파라미터를 가진 Qwen3.8-Flash-Next 모델이 단일 DGX Spark 환경에서 43.9 tok/s의 추론 속도를 기록했습니다. 이는 동일 환경에서 27B dense 모델인 Qwen3.8-27B(11.2 tok/s)보다 4배 빠른 성능입니다. Qwen3.8-Flash-Next는 토큰당 7.31B 파라미터를 활성화하고 내장된 draft head를 통한 speculative decoding을 활용합니다. 테스트는 vLLM 서버, FP8 KV 캐시, MTP depth 3 설정의 GB10 Blackwell 하드웨어 환경에서 진행되었습니다. 해당 모델은 123.53 GiB의 텐서 데이터를 보유하며 121.7 GiB의 메모리 환경에서 구동되었습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3.8-Flash-Next (180B MoE) on one DGX Spark: 43.9 tok/s. The same machine gave 11.2 tok/s with Qwen3.8-27B dense model.

원문 보기 ↗

광고

다음 뉴스 →

중요스페이스X, 미공개 고객과 월 1.5조 규모 데이터센터 호스팅 계약

우주기업까지 AI 인프라 시장 진입. 컴퓨팅 공급자 다변화 흐름 주시할 만함.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스