8개 Radeon Pro V620 활용한 대규모 VRAM 로컬 추론 서버 구축기
vLLM 및 커스텀 포크 활용으로 가성비 높은 고성능 로컬 추론 환경 구성 가능성 제시.
요약
한 사용자가 8개의 Radeon Pro V620(각 32GB VRAM, 총 256GB VRAM)을 활용한 저가형 고성능 LLM 서버를 구축하여 주목받고 있습니다. 기존 llama.cpp 사용 시 발생했던 프리필(prefill) 속도 저하와 동시성 처리 문제를 해결하기 위해, vLLM 커스텀 포크를 적용했습니다. 이를 통해 Qwen3.8-Flash-Next 모델 구동 시 디코드 속도 60~100 t/s, 프리필 속도 3000+ t/s라는 유의미한 성능을 확보했습니다. 해당 카드는 RDNA2 아키텍처 기반의 엔터프라이즈용 클라우드 게이밍 GPU로, 고용량 VRAM을 저렴하게 확보하려는 사용자들에게 대안이 될 수 있습니다. 단, 현재는 과거와 달리 저렴한 가격에 해당 카드를 구하기 어려울 수 있다는 점을 유의해야 합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 $2800 rig with 8x Radeon Pro V620 (256 GB VRAM) + custom vLLM fork = Qwen3.8-Flash-Next at 60 to 100 t/s decode and 3000+ t/s prefill
원문 보기 ↗