← promppy_ 실시간 AI 뉴스
참고Reddit

RTX 3060 4장으로 DeepSeek-V4-Flash를 360k 컨텍스트로 구동하는 설정

llama.cpp를 사용하여 다중 GPU 환경에서 대규모 모델의 긴 컨텍스트 윈도우를 효율적으로 운용하는 구체적인 설정값.

요약

한 레딧 사용자가 NVIDIA RTX 3060 12GB 그래픽카드 4장을 활용해 143~144 GiB 규모의 DeepSeek-V4-Flash-0731 UD-Q4_K_XL GGUF 모델을 성공적으로 구동했다. 총 48GB의 VRAM 환경에서 360k~376k에 달하는 대규모 컨텍스트 윈도우를 유지하며 초당 약 100 토큰의 프롬프트 처리 속도를 기록했다. 이를 위해 Intel Core i9-10920X CPU와 128GB RAM 시스템 기반의 llama.cpp 빌드 b10181 엔진을 사용했다. 해당 설정에서는 -ncmoe 34 옵션과 GPU별 ffn_exps 레이어 분할 등을 포함한 최적화 파라미터가 적용되었다. 실무자는 이 구성을 통해 일반적인 저예산 하드웨어 환경에서도 대형 언어 모델의 추론 및 긴 문맥 처리가 가능함을 확인할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Running DeepSeek V4 Flash Q4_K_XL at ~100 tok/s prompt processing on 4× RTX 3060 12GB

원문 보기 ↗
다음 뉴스 →

중요Cerebras, GPU 대비 추론 30배 빠른 랙 규모 시스템 'CS-4' 공개

WSE-3 Turbo 3개로 와트당 처리량 10배. 대규모 추론 인프라 GPU 대안 검토 여지.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스