← promppy_ 실시간 AI 뉴스
참고Reddit

Qwen3.8-Flash-Next 125B 모델, Strix Halo 미니 PC 구동기

추론 엔진 최적화를 통해 125B MoE 모델도 단일 워크스테이션급 PC에서 40~60 tok/s 확보.

요약

AMD Strix Halo 기반 미니 PC(Ryzen AI Max+ 395, 128GB RAM)에서 125B 파라미터 규모의 Qwen3.8-Flash-Next 모델을 성공적으로 구동했다. 이번 테스트에서는 ExLlamaV3 기반의 추론 엔진 Kyojin과 95GB EXL3 가중치를 활용했으며, speculative decoding 적용 시 초당 44~59 토큰의 디코딩 속도를 기록했다. 프리필(prefill) 속도는 4K부터 128K 문맥까지 약 1,367~1,486 tok/s로 매우 안정적인 성능을 보였다. 또한 64K 문맥 환경에서도 '니들 인 어 헤이스택(needle in a haystack)' 테스트를 완벽하게 통과했다. 현재 Kyojin 엔진은 오픈소스로 공개되었으며, 향후 성능 최적화 업데이트가 지속될 예정이다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3.8-Flash-Next (125B) on a single Strix Halo mini PC: 44-59 tok/s with speculative decoding, ~1,400 tok/s prefill, engine is open

원문 보기 ↗

광고

다음 뉴스 →

중요트럼프, 대통령 직속 AI 전담 태스크포스 신설… 120일 내 보고서 제출

미국의 AI 정책·규제 방향이 구체화될 전망. 미국향 서비스·수출 기업은 규제 동향 모니터링 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스