← promppy_ 실시간 AI 뉴스
참고Reddit

저사양 환경용 추론 엔진 'Mference' 공개: 5GB VRAM으로 DeepSeek-V4-Flash 구동

메모리 최적화를 통해 5.3GB VRAM에서 대규모 모델 구동 성공. 저사양 로컬 서빙 최적화 시 참고.

요약

Reddit의 r/LocalLLaMA 커뮤니티에 MoE 모델을 효율적으로 실행하기 위한 새로운 추론 엔진 'Mference'가 공개되었습니다. Mference는 모델의 공유 코어와 KV 캐시만 메모리에 상주시키고, 선택된 전문가(Expert) 모델을 SSD에서 스트리밍하는 방식으로 메모리 사용량을 획기적으로 줄였습니다. 이 기술을 통해 DeepSeek-V4-Flash 284B-A13B 모델을 약 5.3GB의 메모리 점유율로 구동하며 초당 4.8 토큰의 속도를 확보했습니다. 또한 Gemma 4 26B-A4B와 Qwen 3.6 35B-A3B 등 다양한 모델도 각각 약 2GB와 1.45GB의 메모리로 실행 가능합니다. 해당 프로젝트는 현재 맥 전용 앱, OpenAI 호환 서버, 로컬 문서 파일 첨부 기능 등을 지원하며 계속해서 지원 모델을 확장할 계획입니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 DeepSeek-V4-Flash 284B on 5.3GB of memory

원문 보기 ↗
다음 뉴스 →

중요OpenAI 미공개 모델 'Astra', 10년 미해결 수학 난제 10건 해결 주장

미검증 SNS 주장이라 신뢰도 유의 필요. 사실이면 차세대 추론모델 성능 기준 재설정 신호.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스