← promppy_ 실시간 AI 뉴스
참고Reddit

iPhone에서 Gemma 2B 로컬 구동 사례: 516MB RAM으로 캘린더 자동화 구현

iOS 기기에서 mmap을 활용해 메모리 점유를 최소화하며 로컬 모델을 구동한 최적화 사례. 온디바이스 에이전트 개발 시 벤치마크로 활용 가능.

요약

한 개발자가 온디바이스 AI의 효율성을 테스트하기 위해 iPhone에서 로컬 모델을 구동하는 파이프라인을 구축했다. llama.cpp(b10075)를 활용해 Gemma-2B 양자화 GGUF 모델을 구동했으며, mmap을 통해 모델 가중치를 디스크에서 페이징하여 활성 RAM 사용량을 약 516MB 수준으로 억제했다. 해당 환경에서 초당 약 21.6 토큰의 생성 속도를 기록하며 iOS 캘린더 작업(EventKit)을 오프라인에서 성공적으로 수행했다. 온디바이스 LLM 구축 시 메모리 점유 문제로 인한 OS의 강제 종료나 발열 스로틀링을 효과적으로 회피할 수 있는 실증 사례를 보여준다. 이는 모바일 환경에서 안정적인 로컬 에이전트 개발을 위한 기술적 가능성을 제시한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Running Gemma 2B locally on iPhone for offline calendar actions (~516 MB active RAM, 21.6 tok/s, GGUF weights)

원문 보기 ↗
다음 뉴스 →

중요젠슨 황, 워싱턴서 여야 의원 회동…'오픈 웨이트=미국 AI 리더십' 설득

오픈 웨이트 정책이 미중 경쟁·규제 프레임으로 전환 중. 오픈모델 활용 서비스는 규제 리스크 주시 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스