참고팁Reddit
3천 달러 규모의 128GB VRAM 로컬 추론 서버 빌드 사례
가정용 고성능 LLM 추론 서버 구성을 위한 하드웨어 조합과 실제 벤치마크 결과 공유.
요약
한 AI 사용자가 3,000달러(약 400만 원) 예산으로 128GB VRAM과 256GB RAM을 갖춘 홈 AI 추론 서버를 구축했다. 주요 사양은 4개의 V620 GPU, 256GB DDR4 RDIMM 2666 메모리, Huanandzhi D12D 메인보드, EPYC 7452 CPU로 구성되었다. 전력 소비량은 프리필(prefill) 시 700~900W, Qwen3.8-next-flash Autoround W4A16 모델 디코딩 시 500~600W 수준이다. vllm 포크와 MTP-2 기술을 활용해 128k 이상의 컨텍스트에서 70tg(토큰/초) 수준의 코드 생성 속도를 구현했다. 작성자는 초기에는 Lenovo p620 워크스테이션을 시도했으나 전용 부품 호환성 문제로 반품하고 직접 조립하는 방식을 택했다고 밝혔다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 3k$ 128GB VRAM + 256GB RAM DDR4 Server
원문 보기 ↗