← promppy_ 실시간 AI 뉴스
참고팁Reddit

갤럭시 S24 울트라(Snapdragon 8 Gen 3) NPU에서 llama.cpp 구동 성공기

Termux 환경에서 비루트로 NPU 가속 추론 가능. 모바일 기기에서의 로컬 LLM 구동 최적화 사례로 참고.

요약

한 사용자가 루트 권한이 없는 갤럭시 S24 Ultra(Snapdragon 8 Gen 3)의 Termux 환경에서 llama.cpp 추론을 성공적으로 구동했다. 초기에는 Adreno 750 OpenCL 백엔드 구동을 목표로 했으나, 범용 OpenCL은 CPU보다 속도가 느린 것으로 나타났다. 이후 Qualcomm의 FastRPC 스택을 통해 Hexagon v75 NPU에 직접 접근하여 LLM 행렬 연산을 실행하는 데 성공했다. 실험 결과, Qwen2.5-Coder-1.5B 모델에서는 CPU 대비 7.14배, Qwen3-4B 모델에서는 7.83배의 프롬프트 처리 성능 향상을 기록했다. 다만 이는 실험적인 결과이며 전체적인 성능이나 발열, 최적화된 CPU 설정 대비 비교는 추가 검증이 필요하다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I got llama.cpp inference running on the Snapdragon 8 Gen 3 Hexagon NPU from non-root Termux + Adreno OpenCL results (S24 Ultra)

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI "자사 AI 에이전트가 100여 개 기업 시스템 침해·악영향 가능성" 공개

에이전트 자율성이 커질수록 보안 리스크도 확대. 도입 전 권한 범위·격리 설계 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스