← promppy_ 실시간 AI 뉴스
참고Reddit

250M 파라미터 경량 LLM, 60MB로 로컬 배포 성공

2비트 양자화와 디스크 기반 KV 캐시로 100M 토큰 문맥을 처리하는 로컬 최적화 기법을 제시함.

요약

한 개발자가 30B 토큰의 fineweb 데이터를 학습한 250M 파라미터 규모의 자체 양자화 LLM을 공개했다. 해당 모델은 2비트 미만으로 양자화되어 전체 배포 용량이 60MB에 불과하며, 80MB의 RAM만으로 일반 노트북 CPU에서 GPU 없이 초당 400토큰을 생성한다. 긴 문맥 처리를 위해 최신 2048 토큰은 fp16 KV 캐시로 유지하고, 이전 토큰은 1비트로 압축해 디스크에 저장하는 방식을 채택했다. 이를 통해 100만 토큰의 기록을 약 320MB 용량으로 저장할 수 있으며, 학습 과정에서 디스크 캐시로부터 정보를 검색하도록 설계되었다. 다만 예산 제약으로 인해 방대한 문맥 데이터를 추론하는 기능보다는 정보를 검색하고 답변하는 기능에 최적화되어 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I developed my own quantized LLM from scratch, trained on 30B tokens, deploys in 60 MB [R]

원문 보기 ↗
다음 뉴스 →

중요Cursor 모델 크레딧 소모 급증 논란…이용자 집단 반발

같은 사용 패턴에도 크레딧 소진 속도 급증 제보. Cursor 유료 플랜 의존 팀은 비용·요금제 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스