참고X
Qwen 3.8 Flash Next, M5 Ultra서 추론 성능 2배 향상
고성능 하드웨어 환경에서의 모델 토큰 처리량 데이터. 로컬/온디바이스 LLM 최적화 관심군에게 참고.
원문 제목 @mweinbach: We are now at 3740 tok/s prefill, 149 tok/s decode batched on M5 Ultra for Qwen 3.8 Flash Next This is nearly double what it was y
원문 보기 ↗