← promppy_ 실시간 AI 뉴스
참고Hacker News

Apple Silicon 가상 환경에서 Llama.cpp 추론 속도 16배 향상

macOS VM 환경의 Metal 커널 설정 최적화만으로도 로컬 LLM 추론 성능을 베어메탈에 근접하게 끌어올릴 수 있음.

요약

macOS 가상화 스택 Lume 개발팀은 Apple Virtualization.framework 환경에서 llama.cpp의 LLM 추론 속도를 최대 11~16배 향상시키는 호환성 레이어를 공개했다. 기존 macOS 가상 머신(VM)에서는 Apple GPU의 Metal 기능을 보수적으로 인식하여 성능 최적화가 어려웠으나, 이번 개발을 통해 게스트 프로세스에서 더 새로운 Metal 커널을 선택할 수 있게 되었다. 실제 M1 Ultra 환경에서 TinyLlama 1.1B 모델을 테스트한 결과, 이전 대비 프롬프트 처리 속도는 11.08배, 토큰 생성 속도는 16.36배 빨라졌으며 프롬프트 처리 성능은 베어메탈의 98% 수준에 도달했다. 이번 연구 결과는 Lume 및 Cua와 동일한 허용 라이선스로 공개되어 누구나 재현 및 검증이 가능하다. 개발팀은 다양한 Apple Silicon 칩과 macOS 버전에서 해당 기술이 어떤 영향을 미치는지 확인하기 위해 소스 코드와 벤치마크 로그를 함께 제공했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp

원문 보기 ↗
다음 뉴스 →

중요OpenAI, ChatGPT Work·Codex에 타 에이전트 작업 동기화 기능 추가

프로젝트·채팅·스킬·플러그인을 가져오고 자동 업데이트 설정 가능. 여러 도구 병행 시 통합 검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스