Qwen 3.8 모델, llama.cpp MTP 플래그 활성화로 로컬 추론 성능 70% 향상
MTP 헤드 사용 설정만으로 Mac에서 추론 속도를 18 tok/s에서 31 tok/s로 높일 수 있는 실전 꿀팁입니다.
요약
한 사용자가 최신 MacBook Pro M5 Max(36GB)와 RTX 5090 워크스테이션에서 Qwen 3.8 27B 모델(Q4_K_M, llama.cpp)의 성능을 벤치마킹한 결과를 공유했습니다. MacBook Pro는 RTX 5090 대비 raw token/s 기준으로는 느렸지만, 예상보다 훨씬 우수한 성능을 보였습니다. 특히 Qwen 3.8 모델에 내장된 'multi-token prediction head' 기능을 활성화할 경우 성능이 비약적으로 향상되는 점이 확인되었습니다. 해당 기능을 사용하지 않으면 llama.cpp가 이를 'unused tensor'로 간주하고 무시하는데, 플래그 설정을 통해 이를 활성화하면 MacBook Pro에서 초당 18토큰에서 31토큰으로 속도가 대폭 증가했습니다. 실무자들은 모델 활용 시 내장된 고급 기능을 활성화하는 플래그를 반드시 확인해야 합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I ran Qwen 3.8 27B on my new MacBook Pro M5 Max and on my RTX 5090 workstation. The Mac held up way better than I expected.
원문 보기 ↗