참고팁Reddit
Qwen 3.8 27B 벤치마크: Strix Halo 환경에서 FP4 양자화로 30 tok/s 달성
특정 하드웨어 환경에서의 로컬 LLM 추론 성능 최적화 수치로, 로컬 LLM 구동 시 벤치마크 데이터로 활용하기 좋습니다.
요약
Strix Halo 노트북(Radeon 8060S, 128GB 통합 메모리) 환경에서 Qwen3.8-27B 모델의 벤치마크 테스트 결과가 공개되었다. 기존의 일반적인 측정 방식 대비 MTP(Multi-Token Prediction) 기술을 적용했을 때 성능 향상이 뚜렷하게 나타났다. llama.cpp b10503 기반의 Q8_0 설정에서는 초당 토큰 처리량(tok/s)이 기존 7.3에서 22.4로 크게 상승했다. 또한 julianmb/q38rocm FP4 포크 버전을 사용했을 때는 최대 29.9 tok/s의 속도를 기록했다. 이번 테스트는 더 정확한 측정을 위해 llama.cpp의 자체 타이밍 블록을 활용하고 클럭 및 패키지 전력을 샘플링하여 수행되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-27B benchmarks on Strix Halo - Q8_0 MTP: 21 t/s, 3x. ROCmFP4 MTP: 26 t/s
원문 보기 ↗