← promppy_ 실시간 AI 뉴스
참고팁Reddit

Qwen 3.8-Flash-Next 인퍼런스 엔진 벤치마크 (Strix Halo 기준)

AMD Strix Halo 환경에서 Halogen과 gufo 엔진별 토큰 생성 성능 비교. 로컬 LLM 인퍼런스 환경 구축 시 참고.

요약

AMD Strix Halo 환경(ASUS ROG Flow Z13 GZ302, Ryzen AI Max+)에서 Qwen 3.8-Flash-Next 모델을 구동하기 위한 엔진별 벤치마크 결과가 공개되었습니다. 테스트 결과, Halogen v0.14.0이 자체 .hgn 가중치를 사용할 때 가장 빠른 처리 속도를 기록했습니다. 반면 오픈소스인 gufo는 콜드 로딩 속도가 4배 빠르고, 후속 질문 시 첫 토큰 생성 속도(1.6~1.9초) 면에서 Halogen(2.6~3.3초)을 앞섰습니다. 이번 벤치마크는 오버헤드가 없는 LlamaStash 오케스트레이터를 사용하여 70W TDP 설정 및 Arch Linux 환경에서 64k 컨텍스트의 50%를 채운 상태로 진행되었습니다. 결과적으로 처리량은 Halogen이 우세하나, 반응성과 개방성 측면에서는 gufo가 강점을 보이는 것으로 나타났습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Benchmarks: Best engine for Qwen 3.8-Flash-Next on Strix Halo

원문 보기 ↗

광고

다음 뉴스 →

속보ChatGPT, 다수 사용자 대상 접속 장애 발생

ChatGPT 의존 서비스라면 장애 알림·폴백 경로 점검. 복구 공지 확인 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스