RTX 3060 4장으로 DeepSeek-V4-Flash를 360k 컨텍스트로 구동하는 설정
llama.cpp를 사용하여 다중 GPU 환경에서 대규모 모델의 긴 컨텍스트 윈도우를 효율적으로 운용하는 구체적인 설정값.
요약
한 레딧 사용자가 NVIDIA RTX 3060 12GB 그래픽카드 4장을 활용해 143~144 GiB 규모의 DeepSeek-V4-Flash-0731 UD-Q4_K_XL GGUF 모델을 성공적으로 구동했다. 총 48GB의 VRAM 환경에서 360k~376k에 달하는 대규모 컨텍스트 윈도우를 유지하며 초당 약 100 토큰의 프롬프트 처리 속도를 기록했다. 이를 위해 Intel Core i9-10920X CPU와 128GB RAM 시스템 기반의 llama.cpp 빌드 b10181 엔진을 사용했다. 해당 설정에서는 -ncmoe 34 옵션과 GPU별 ffn_exps 레이어 분할 등을 포함한 최적화 파라미터가 적용되었다. 실무자는 이 구성을 통해 일반적인 저예산 하드웨어 환경에서도 대형 언어 모델의 추론 및 긴 문맥 처리가 가능함을 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Running DeepSeek V4 Flash Q4_K_XL at ~100 tok/s prompt processing on 4× RTX 3060 12GB
원문 보기 ↗