M1 Max에서 Qwen3.8-Flash-Next 구동 결과: 400K 컨텍스트 유지하며 35 tok/s 확보
로컬 LLM 구동 시 롱 컨텍스트 환경에서 성능 저하를 최소화하는 최적화 사례. 로컬 추론 벤치마크 및 설정 참고용.
요약
로컬 LLM 커뮤니티에서 Qwen3.8-Flash-Next 모델을 2021년형 M1 Max(32 GPU 코어, 64GB RAM)에서 구동한 결과가 공유되었다. antirez의 ds4(DwarfStar) 엔진을 기반으로 M1 가속 최적화를 진행했으며, MTP(Multi-Token Prediction) 기능을 활성화한 상태에서 4K 컨텍스트 기준 초당 44토큰, 약 400K 컨텍스트에서도 초당 35.4토큰의 일관된 성능을 보였다. 5분간의 루프 테스트에서도 성능 저하 없이 평균 43 tok/s를 유지했으며, GPU 온도는 73~75도 수준으로 발열로 인한 스로틀링 현상도 나타나지 않았다. 이번 테스트는 긴 문맥을 처리하는 에이전트 세션에서도 로컬 모델의 성능 하락이 거의 없음을 실증적으로 보여주었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-Flash-Next on a 2021 M1 Max: 44 tok/s, and still 35 tok/s with 400K tokens in the context
원문 보기 ↗