AMD 라데온 전용 Windows 추론 엔진 'WHIRL' 공개
WSL 없이 RDNA GPU를 네이티브로 지원해 AMD 환경에서 LLM 추론 성능을 최적화할 수 있음.
요약
AMD Radeon AI PRO R9700 GPU 전용 오픈소스 추론 엔진 WHIRL(Windows HIP Inference for RDNA LLMs)이 공개되었습니다. 이 엔진은 WSL이나 가상 머신(VM) 없이 윈도우 환경에서 직접 구동되며, llama.cpp를 기반으로 하지 않는 순수 C++ 및 HIP 코드로 구현되었습니다. AMD Adrenalin 드라이버만 설치하면 즉시 사용 가능하며 소스 빌드 시에만 HIP SDK가 필요합니다. Qwen3.8-27B 모델을 MXFP4 포맷으로 실행할 경우, 기존 llama.cpp 대비 프리필(prefill) 속도는 최대 2.5배 빠르며 디코드(decode) 속도는 107~328 tok/s, 서버 처리량은 3배까지 향상되는 성능을 보입니다. 범용 엔진이 아닌 특정 하드웨어에 최적화된 엔진으로, 하드웨어 성능을 극한까지 끌어올리는 것을 목표로 합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 WHIRL: an open-source native Windows inference engine for the Radeon AI PRO R9700 (C++/HIP, no WSL). Qwen3.8-27B fine-tune in MXFP4: up to 2.5× llama.cpp prefill, 107–328 tok/s decode, 3× server throughput
원문 보기 ↗