← promppy_ 실시간 AI 뉴스
참고팁Reddit

M1 Max에서 Qwen3.8-27B 구동: 커스텀 Metal 커널로 39 tok/s 달성

애플 실리콘 환경에서 로컬 LLM 추론 성능을 극대화할 수 있는 커널 튜닝 및 최적화 노하우.

요약

최근 Reddit의 LocalLLM 커뮤니티에서 기존 M3 이상의 칩셋에서만 작동하던 로컬 추론 엔진 'Splash'를 M1 Max 기기에서도 구동할 수 있도록 포팅하고 커스텀 Metal 커널을 작성한 사례가 공유되었다. 개발자는 Qwen3.8-27B 모델을 2021년형 M1 Max에서 구동하여 평균 39 tok/s의 속도를 달성했으며, 이는 기존 Splash 커널 대비 19 tok/s에서 두 배가량 향상된 수치이다. 실제 코딩 에이전트 환경(30K~90K 컨텍스트)에서도 19~36 tok/s의 준수한 추론 속도를 기록했다. Inco 팀이 지난주 공개한 Splash 1.0은 Apple 실리콘에 최적화된 로컬 추론 엔진으로, 모델별 맞춤형 Metal 커널과 DFlash 추론 디코딩 기술을 통해 높은 성능을 제공한다. 이번 포팅 성공으로 구형 Apple 실리콘 환경에서도 최신 고성능 LLM 추론 엔진의 활용 가능성이 확대되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 You can now run Qwen3.8-27B on a 2021 M1 Max at 39 tok/s: I ported Splash (M3+ only) and wrote custom Metal kernels

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI, 더 상위 등급의 ChatGPT Pro 요금제 준비 중

고가 상위 요금제 신설 조짐. 고급 모델·기능이 유료 티어로 분리될 가능성 점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스