← promppy_ 실시간 AI 뉴스
참고Reddit

안드로이드 기기에서 동작하는 LFM2.5-2.6B 엔진 구현

최적화된 로컬 추론 엔진을 통해 모바일 환경에서 에이전트용 모델을 효율적으로 구동하는 기술적 실증 사례입니다.

요약

Reddit의 r/LocalLLaMA 커뮤니티에 LFM2.5-2.6B 모델을 OnePlus 13에서 구동한 사례가 공유되었다. 해당 모델은 2.69B 파라미터와 128K 컨텍스트 윈도우를 지원하며 다단계 에이전트 워크플로우를 위해 설계되었다. 작성자는 직접 개발한 450kb 규모의 추론 엔진을 사용하여 Q4_K_M GGUF 양자화 모델을 구동했고, 순수 CPU 환경에서 초당 17 토큰의 속도를 기록했다. 이 추론 엔진은 ADB를 통해 제어되며 Qwen, Gemma, Bonsai 등 다양한 모델 아키텍처를 지원한다. 개발자는 향후 최적화를 통해 구동 속도를 초당 30 토큰 수준까지 끌어올릴 계획이다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 LFM2.5-2.6B on a OnePlus 13 at 17 tok/s ~ Pure CPU

원문 보기 ↗
다음 뉴스 →

중요OpenAI-Hugging Face 보안 사고, Black Hat 발표로 상세 타임라인 공개

실제 사고 대응 과정과 교훈 정리. AI 공급망·연동 보안 점검 시 참고 가치 있음.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

최신 뉴스