참고팁Reddit
저사양 환경용 추론 엔진 'Mference' 공개: 5GB VRAM으로 DeepSeek-V4-Flash 구동
메모리 최적화를 통해 5.3GB VRAM에서 대규모 모델 구동 성공. 저사양 로컬 서빙 최적화 시 참고.
요약
Reddit의 r/LocalLLaMA 커뮤니티에 MoE 모델을 효율적으로 실행하기 위한 새로운 추론 엔진 'Mference'가 공개되었습니다. Mference는 모델의 공유 코어와 KV 캐시만 메모리에 상주시키고, 선택된 전문가(Expert) 모델을 SSD에서 스트리밍하는 방식으로 메모리 사용량을 획기적으로 줄였습니다. 이 기술을 통해 DeepSeek-V4-Flash 284B-A13B 모델을 약 5.3GB의 메모리 점유율로 구동하며 초당 4.8 토큰의 속도를 확보했습니다. 또한 Gemma 4 26B-A4B와 Qwen 3.6 35B-A3B 등 다양한 모델도 각각 약 2GB와 1.45GB의 메모리로 실행 가능합니다. 해당 프로젝트는 현재 맥 전용 앱, OpenAI 호환 서버, 로컬 문서 파일 첨부 기능 등을 지원하며 계속해서 지원 모델을 확장할 계획입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 DeepSeek-V4-Flash 284B on 5.3GB of memory
원문 보기 ↗