Qwen3.8-Flash-Next 125B 모델, Strix Halo 미니 PC 구동기
추론 엔진 최적화를 통해 125B MoE 모델도 단일 워크스테이션급 PC에서 40~60 tok/s 확보.
요약
AMD Strix Halo 기반 미니 PC(Ryzen AI Max+ 395, 128GB RAM)에서 125B 파라미터 규모의 Qwen3.8-Flash-Next 모델을 성공적으로 구동했다. 이번 테스트에서는 ExLlamaV3 기반의 추론 엔진 Kyojin과 95GB EXL3 가중치를 활용했으며, speculative decoding 적용 시 초당 44~59 토큰의 디코딩 속도를 기록했다. 프리필(prefill) 속도는 4K부터 128K 문맥까지 약 1,367~1,486 tok/s로 매우 안정적인 성능을 보였다. 또한 64K 문맥 환경에서도 '니들 인 어 헤이스택(needle in a haystack)' 테스트를 완벽하게 통과했다. 현재 Kyojin 엔진은 오픈소스로 공개되었으며, 향후 성능 최적화 업데이트가 지속될 예정이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-Flash-Next (125B) on a single Strix Halo mini PC: 44-59 tok/s with speculative decoding, ~1,400 tok/s prefill, engine is open
원문 보기 ↗