llama.cpp, MTP 텐서 기본 로드 이슈…불필요한 VRAM 점유 주의
최신 빌드에서 MTP 텐서가 기본 활성화되어 VRAM을 추가 점유하므로, GGUF 로컬 추론 시 메모리 최적화 확인이 필요합니다.
요약
최근 llama.cpp 빌드에서 MTP(Multi-Token Prediction) 텐서가 포함된 GGUF 모델은 '--spec-type draft-mtp' 옵션을 활성화하지 않아도 기본적으로 MTP 텐서를 로드하도록 변경되었습니다. GLM-5.2, hy_v3, qwen35moe, step35 등 MTP/NextN 텐서가 포함된 대부분의 커뮤니티 GGUF 모델을 사용할 때 주의가 필요합니다. 이전 버전과 달리 이제는 MTP 기능을 사용하지 않더라도 MTP 블록이 기본적으로 로드되어 추가적인 VRAM 및 RAM을 점유하게 됩니다. 이는 약 1개의 MoE 레이어 분량에 해당하는 리소스를 추가로 소비하는 것으로, 메모리 효율이 중요한 실무 환경에서는 모델 로드 시 VRAM 사용량 증가를 인지해야 합니다. 관련 상세 내용은 llama.cpp의 25980번 풀 리퀘스트(PR)를 통해 확인할 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 PSA: llama.cpp now loads MTP tensors by default for any draft-mtp arch, even with MTP disabled
원문 보기 ↗