← promppy_ 실시간 AI 뉴스
참고Reddit

12GB RAM 모바일에서 92GB 모델 구동: Llama.cpp 최적화 사례

LLM 모듈화 엔진을 통해 저사양 환경에서 대형 모델 구동 성공. 온디바이스 AI 경량화 시 참고 가능.

요약

최근 12GB RAM을 탑재한 중급형 안드로이드 기기에서 92GB 규모의 DeepSeek V4 Flash IQ2_M 모델이 초당 1토큰 속도로 구동되는 사례가 보고되었다. 해당 엔진은 llama.cpp 기반의 모듈성을 활용해 Gemma 26B, Qwen 3 등 다양한 대형 언어 모델을 모바일 환경에서 실행할 수 있게 한다. 개발자는 BigMoeOnEdge 프로젝트를 통해 단 한 줄의 코드로 지원되는 모든 대형 MoE 모델을 모바일 및 일반 PC에서 구동할 수 있다고 밝혔다. 현재 기술적 구현 단계로서 실용적인 사용은 어렵지만, 모바일 기기에서의 대형 모델 구동 가능성을 입증했다는 점에서 의미가 있다. 구체적인 구현 내용은 GitHub 저장소(Helldez/BigMoeOnEdge)를 통해 확인할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 DeepSeek V4 Flash IQ2_M (92 GB) debut on a mid range mobile with 12 GB of RAM at 1 tok/s and many other models...

원문 보기 ↗
다음 뉴스 →

중요Black Forest Labs, 이미지·비디오·오디오 통합 'FLUX 3' 공개

현재는 게이트형 얼리 액세스. Dev 오픈 웨이트 출시 여부가 실사용 관건이며 성능 수치는 내부 자료로 검증 필요

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스