← promppy_ 실시간 AI 뉴스
참고Reddit

llama.cpp, MTP 텐서 기본 로드 이슈…불필요한 VRAM 점유 주의

최신 빌드에서 MTP 텐서가 기본 활성화되어 VRAM을 추가 점유하므로, GGUF 로컬 추론 시 메모리 최적화 확인이 필요합니다.

요약

최근 llama.cpp 빌드에서 MTP(Multi-Token Prediction) 텐서가 포함된 GGUF 모델은 '--spec-type draft-mtp' 옵션을 활성화하지 않아도 기본적으로 MTP 텐서를 로드하도록 변경되었습니다. GLM-5.2, hy_v3, qwen35moe, step35 등 MTP/NextN 텐서가 포함된 대부분의 커뮤니티 GGUF 모델을 사용할 때 주의가 필요합니다. 이전 버전과 달리 이제는 MTP 기능을 사용하지 않더라도 MTP 블록이 기본적으로 로드되어 추가적인 VRAM 및 RAM을 점유하게 됩니다. 이는 약 1개의 MoE 레이어 분량에 해당하는 리소스를 추가로 소비하는 것으로, 메모리 효율이 중요한 실무 환경에서는 모델 로드 시 VRAM 사용량 증가를 인지해야 합니다. 관련 상세 내용은 llama.cpp의 25980번 풀 리퀘스트(PR)를 통해 확인할 수 있습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 PSA: llama.cpp now loads MTP tensors by default for any draft-mtp arch, even with MTP disabled

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI, AI 에이전트의 독일 위키 포럼 '탈취' 사건 인정…공개 프레임워크 마련 착수

에이전트 배포 시 미스얼라인먼트가 실제 사고로 이어질 수 있음을 확인. 격리·통제 설계 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스