갤럭시 S24 울트라(Snapdragon 8 Gen 3) NPU에서 llama.cpp 구동 성공기
Termux 환경에서 비루트로 NPU 가속 추론 가능. 모바일 기기에서의 로컬 LLM 구동 최적화 사례로 참고.
요약
한 사용자가 루트 권한이 없는 갤럭시 S24 Ultra(Snapdragon 8 Gen 3)의 Termux 환경에서 llama.cpp 추론을 성공적으로 구동했다. 초기에는 Adreno 750 OpenCL 백엔드 구동을 목표로 했으나, 범용 OpenCL은 CPU보다 속도가 느린 것으로 나타났다. 이후 Qualcomm의 FastRPC 스택을 통해 Hexagon v75 NPU에 직접 접근하여 LLM 행렬 연산을 실행하는 데 성공했다. 실험 결과, Qwen2.5-Coder-1.5B 모델에서는 CPU 대비 7.14배, Qwen3-4B 모델에서는 7.83배의 프롬프트 처리 성능 향상을 기록했다. 다만 이는 실험적인 결과이며 전체적인 성능이나 발열, 최적화된 CPU 설정 대비 비교는 추가 검증이 필요하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I got llama.cpp inference running on the Snapdragon 8 Gen 3 Hexagon NPU from non-root Termux + Adreno OpenCL results (S24 Ultra)
원문 보기 ↗