Intel Arc GPU용 네이티브 추론 엔진 'GRIMOIRE' 공개
Intel Battlemage 환경에서 LLM 추론 성능을 최적화할 수 있는 커스텀 C++/SYCL 엔진.
요약
인텔 Battlemage GPU(Arc Pro B70)를 위한 네이티브 LLM 추론 엔진 GRIMOIRE가 공개되었습니다. GRIMOIRE는 vLLM이나 PyTorch, OpenVINO를 의존하지 않고 C++와 SYCL, Level Zero를 사용하여 독자적인 추론 커널을 구축했습니다. 어텐션, 행렬 곱셈, 양자화 가중치, MoE(Mixture of Experts) 연산에 자체 커널을 최적화하여 성능을 극대화했습니다. 벤치마크 결과 Ornith 1.5 모델 기준 단일 요청 시 175 tok/s, 동시 요청 8개 환경에서 464 tok/s의 처리 속도를 기록했습니다. 이번 프로젝트는 타 GPU 플랫폼 중심의 추론 생태계에서 인텔 하드웨어의 성능 잠재력을 직접 측정하고 최적화하기 위해 시작되었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 GRIMOIRE: native C++/SYCL LLM inference for Intel Arc Pro B70 — Ornith 1.5 hits 175 tok/s single request, 464 tok/s at concurrency 8
원문 보기 ↗