참고팁Reddit
250M 파라미터 경량 LLM, 60MB로 로컬 배포 성공
2비트 양자화와 디스크 기반 KV 캐시로 100M 토큰 문맥을 처리하는 로컬 최적화 기법을 제시함.
요약
한 개발자가 30B 토큰의 fineweb 데이터를 학습한 250M 파라미터 규모의 자체 양자화 LLM을 공개했다. 해당 모델은 2비트 미만으로 양자화되어 전체 배포 용량이 60MB에 불과하며, 80MB의 RAM만으로 일반 노트북 CPU에서 GPU 없이 초당 400토큰을 생성한다. 긴 문맥 처리를 위해 최신 2048 토큰은 fp16 KV 캐시로 유지하고, 이전 토큰은 1비트로 압축해 디스크에 저장하는 방식을 채택했다. 이를 통해 100만 토큰의 기록을 약 320MB 용량으로 저장할 수 있으며, 학습 과정에서 디스크 캐시로부터 정보를 검색하도록 설계되었다. 다만 예산 제약으로 인해 방대한 문맥 데이터를 추론하는 기능보다는 정보를 검색하고 답변하는 기능에 최적화되어 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I developed my own quantized LLM from scratch, trained on 30B tokens, deploys in 60 MB [R]
원문 보기 ↗