Apple Silicon 가상 환경에서 Llama.cpp 추론 속도 16배 향상
macOS VM 환경의 Metal 커널 설정 최적화만으로도 로컬 LLM 추론 성능을 베어메탈에 근접하게 끌어올릴 수 있음.
요약
macOS 가상화 스택 Lume 개발팀은 Apple Virtualization.framework 환경에서 llama.cpp의 LLM 추론 속도를 최대 11~16배 향상시키는 호환성 레이어를 공개했다. 기존 macOS 가상 머신(VM)에서는 Apple GPU의 Metal 기능을 보수적으로 인식하여 성능 최적화가 어려웠으나, 이번 개발을 통해 게스트 프로세스에서 더 새로운 Metal 커널을 선택할 수 있게 되었다. 실제 M1 Ultra 환경에서 TinyLlama 1.1B 모델을 테스트한 결과, 이전 대비 프롬프트 처리 속도는 11.08배, 토큰 생성 속도는 16.36배 빨라졌으며 프롬프트 처리 성능은 베어메탈의 98% 수준에 도달했다. 이번 연구 결과는 Lume 및 Cua와 동일한 허용 라이선스로 공개되어 누구나 재현 및 검증이 가능하다. 개발팀은 다양한 Apple Silicon 칩과 macOS 버전에서 해당 기술이 어떤 영향을 미치는지 확인하기 위해 소스 코드와 벤치마크 로그를 함께 제공했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp
원문 보기 ↗