Qwen3.8-Flash-Next 1M 컨텍스트 벤치마크: Strix Halo 환경 성능 결과
Strix Halo 하드웨어에서 1M 컨텍스트 처리 시 decode/prefill 성능 데이터 공유. 로컬 LLM 추론 환경 최적화 시 벤치마크 자료로 활용 가능.
요약
최신 'halogen 0.12.0' 업데이트를 통해 Ryzen AI Max+ 395 기반 시스템에서 'Qwen3.8-Flash-Next' 모델의 1M 컨텍스트 처리 성능이 크게 개선되었다. 1,004,581 토큰 컨텍스트 기준 디코드 속도는 기존 27.3 tok/s에서 38.3 tok/s로 약 40% 향상되었다. 또한 동일한 컨텍스트 환경에서 프리필(prefill) 속도는 790 tok/s에서 937 tok/s로 개선되었으며, 콜드 프리필 소요 시간은 약 21.2분에서 17.9분으로 단축되었다. 프롬프트 캐시를 활용한 후속 요청의 경우 첫 토큰 생성까지 약 0.55초가 소요되어 매우 빠른 반응 속도를 보였다. 이번 업데이트는 기존 버전에서 보고된 깊은 컨텍스트 환경에서의 성능 저하 문제를 해결하는 데 중점을 두었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-Flash-Next at 1M context on Strix Halo: 38 tok/s decode, 18 min prefill (halogen 0.12.0)
원문 보기 ↗