← promppy_ 실시간 AI 뉴스
참고Reddit

3천 달러 규모의 128GB VRAM 로컬 추론 서버 빌드 사례

가정용 고성능 LLM 추론 서버 구성을 위한 하드웨어 조합과 실제 벤치마크 결과 공유.

요약

한 AI 사용자가 3,000달러(약 400만 원) 예산으로 128GB VRAM과 256GB RAM을 갖춘 홈 AI 추론 서버를 구축했다. 주요 사양은 4개의 V620 GPU, 256GB DDR4 RDIMM 2666 메모리, Huanandzhi D12D 메인보드, EPYC 7452 CPU로 구성되었다. 전력 소비량은 프리필(prefill) 시 700~900W, Qwen3.8-next-flash Autoround W4A16 모델 디코딩 시 500~600W 수준이다. vllm 포크와 MTP-2 기술을 활용해 128k 이상의 컨텍스트에서 70tg(토큰/초) 수준의 코드 생성 속도를 구현했다. 작성자는 초기에는 Lenovo p620 워크스테이션을 시도했으나 전용 부품 호환성 문제로 반품하고 직접 조립하는 방식을 택했다고 밝혔다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 3k$ 128GB VRAM + 256GB RAM DDR4 Server

원문 보기 ↗

광고

다음 뉴스 →

중요찰스 3세 국왕, NVIDIA·Google·OpenAI·Anthropic 리더 스코틀랜드 소집... AI 개발 속도 조절 논의

AI 규제·거버넌스 논의 본격화 신호. 글로벌 정책 방향이 서비스 로드맵에 미칠 영향 주시 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스