Qwen 3.8-Flash-Next 인퍼런스 엔진 벤치마크 (Strix Halo 기준)
AMD Strix Halo 환경에서 Halogen과 gufo 엔진별 토큰 생성 성능 비교. 로컬 LLM 인퍼런스 환경 구축 시 참고.
요약
AMD Strix Halo 환경(ASUS ROG Flow Z13 GZ302, Ryzen AI Max+)에서 Qwen 3.8-Flash-Next 모델을 구동하기 위한 엔진별 벤치마크 결과가 공개되었습니다. 테스트 결과, Halogen v0.14.0이 자체 .hgn 가중치를 사용할 때 가장 빠른 처리 속도를 기록했습니다. 반면 오픈소스인 gufo는 콜드 로딩 속도가 4배 빠르고, 후속 질문 시 첫 토큰 생성 속도(1.6~1.9초) 면에서 Halogen(2.6~3.3초)을 앞섰습니다. 이번 벤치마크는 오버헤드가 없는 LlamaStash 오케스트레이터를 사용하여 70W TDP 설정 및 Arch Linux 환경에서 64k 컨텍스트의 50%를 채운 상태로 진행되었습니다. 결과적으로 처리량은 Halogen이 우세하나, 반응성과 개방성 측면에서는 gufo가 강점을 보이는 것으로 나타났습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Benchmarks: Best engine for Qwen 3.8-Flash-Next on Strix Halo
원문 보기 ↗