M1 Max에서 Qwen3.8-27B 구동: 커스텀 Metal 커널로 39 tok/s 달성
애플 실리콘 환경에서 로컬 LLM 추론 성능을 극대화할 수 있는 커널 튜닝 및 최적화 노하우.
요약
최근 Reddit의 LocalLLM 커뮤니티에서 기존 M3 이상의 칩셋에서만 작동하던 로컬 추론 엔진 'Splash'를 M1 Max 기기에서도 구동할 수 있도록 포팅하고 커스텀 Metal 커널을 작성한 사례가 공유되었다. 개발자는 Qwen3.8-27B 모델을 2021년형 M1 Max에서 구동하여 평균 39 tok/s의 속도를 달성했으며, 이는 기존 Splash 커널 대비 19 tok/s에서 두 배가량 향상된 수치이다. 실제 코딩 에이전트 환경(30K~90K 컨텍스트)에서도 19~36 tok/s의 준수한 추론 속도를 기록했다. Inco 팀이 지난주 공개한 Splash 1.0은 Apple 실리콘에 최적화된 로컬 추론 엔진으로, 모델별 맞춤형 Metal 커널과 DFlash 추론 디코딩 기술을 통해 높은 성능을 제공한다. 이번 포팅 성공으로 구형 Apple 실리콘 환경에서도 최신 고성능 LLM 추론 엔진의 활용 가능성이 확대되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 You can now run Qwen3.8-27B on a 2021 M1 Max at 39 tok/s: I ported Splash (M3+ only) and wrote custom Metal kernels
원문 보기 ↗