참고팁Reddit
안드로이드 기기에서 동작하는 LFM2.5-2.6B 엔진 구현
최적화된 로컬 추론 엔진을 통해 모바일 환경에서 에이전트용 모델을 효율적으로 구동하는 기술적 실증 사례입니다.
요약
Reddit의 r/LocalLLaMA 커뮤니티에 LFM2.5-2.6B 모델을 OnePlus 13에서 구동한 사례가 공유되었다. 해당 모델은 2.69B 파라미터와 128K 컨텍스트 윈도우를 지원하며 다단계 에이전트 워크플로우를 위해 설계되었다. 작성자는 직접 개발한 450kb 규모의 추론 엔진을 사용하여 Q4_K_M GGUF 양자화 모델을 구동했고, 순수 CPU 환경에서 초당 17 토큰의 속도를 기록했다. 이 추론 엔진은 ADB를 통해 제어되며 Qwen, Gemma, Bonsai 등 다양한 모델 아키텍처를 지원한다. 개발자는 향후 최적화를 통해 구동 속도를 초당 30 토큰 수준까지 끌어올릴 계획이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 LFM2.5-2.6B on a OnePlus 13 at 17 tok/s ~ Pure CPU
원문 보기 ↗