구형 AMD Vega GPU 환경에서 ROCm 7.2.1 + llama.cpp 구동법
공식 지원이 끊긴 Vega 아키텍처 환경에서 llama.cpp를 최적화하여 50 tok/s 이상 확보하는 재현 가능한 가이드.
요약
AMD의 구형 아키텍처인 Vega GPU(gfx900 Vega64 및 gfx906 MI50) 혼합 환경에서 최신 llama.cpp를 구동하는 설정법이 공유되었습니다. 최신 ROCm 7.2.1은 기본적으로 레거시 아키텍처를 위한 rocBLAS/Tensile 페이로드를 포함하지 않아 실행 오류가 발생합니다. 이를 해결하기 위해 ROCm 7.2.1 이미지를 gfx906용으로 패치하고, ROCm 6.3.4에서 gfx900용 페이로드를 가져와 결합하는 방식이 제시되었습니다. 해당 환경에서 Gemma 3 27B Q4 모델 실행 시 52~57 tok/s의 성능을 기록했습니다. 상세한 설정 방법과 Dockerfile은 GitHub 저장소를 통해 확인할 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 ROCm 7.2.1 + llama.cpp on mixed Vega GPUs (gfx900 Vega64 + gfx906 MI50) — got 52-57 tok/s on Gemma 3 27B Q4 with patched rocBLAS payloads [repo + Dockerfile]
원문 보기 ↗