DeepSeek V4-Flash 284B, 중고 서버 및 RTX 3090 환경에서 구동 성공 사례 공유
156GB 모델을 상용 고가 장비 없이 합리적 예산의 서버 환경에서 추론 가능함을 입증한 구체적 설정 공유.
요약
DeepSeek V4-Flash(284B MoE) 모델을 일반적인 중고 서버 하드웨어에서 구동한 사례가 Reddit r/LocalLLaMA 커뮤니티에서 화제이다. 해당 모델은 전체 체크포인트 기준 156GB의 메모리를 요구하며, 작성자는 2개의 RTX 3090 GPU와 쿼드 Xeon DDR4 서버를 조합하여 단일 33 tok/s, 합산 68 tok/s의 추론 속도를 달성했다. 이번 테스트는 156GB 용량의 모델을 로드하기 위해 Mac Studio M3 Ultra, RTX PRO 6000 등 고가의 장비조차 메모리 한계로 구동이 불가능하거나 재양자화가 필요한 상황에서 가성비 높은 하드웨어 구성의 가능성을 보여주었다. 특히 대규모 모델 구동 시 메모리 대역폭과 용량 확보가 필수적임을 강조하며, 512~768GB의 시스템 메모리를 갖춘 중고 R940 서버와 3090 GPU 조합이 공식 체크포인트 구동의 효율적인 대안이 될 수 있음을 입증했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 DeepSeek V4-Flash (284B MoE) at 33 tok/s single / 68 tok/s aggregate on 2× RTX 3090 + a used quad-Xeon DDR4 server — full config
원문 보기 ↗