iPhone에서 Gemma 2B 로컬 구동 사례: 516MB RAM으로 캘린더 자동화 구현
iOS 기기에서 mmap을 활용해 메모리 점유를 최소화하며 로컬 모델을 구동한 최적화 사례. 온디바이스 에이전트 개발 시 벤치마크로 활용 가능.
요약
한 개발자가 온디바이스 AI의 효율성을 테스트하기 위해 iPhone에서 로컬 모델을 구동하는 파이프라인을 구축했다. llama.cpp(b10075)를 활용해 Gemma-2B 양자화 GGUF 모델을 구동했으며, mmap을 통해 모델 가중치를 디스크에서 페이징하여 활성 RAM 사용량을 약 516MB 수준으로 억제했다. 해당 환경에서 초당 약 21.6 토큰의 생성 속도를 기록하며 iOS 캘린더 작업(EventKit)을 오프라인에서 성공적으로 수행했다. 온디바이스 LLM 구축 시 메모리 점유 문제로 인한 OS의 강제 종료나 발열 스로틀링을 효과적으로 회피할 수 있는 실증 사례를 보여준다. 이는 모바일 환경에서 안정적인 로컬 에이전트 개발을 위한 기술적 가능성을 제시한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Running Gemma 2B locally on iPhone for offline calendar actions (~516 MB active RAM, 21.6 tok/s, GGUF weights)
원문 보기 ↗