참고팁Reddit
250M 파라미터 경량 LLM 공개: 60MB 용량으로 로컬 CPU 구동
2비트 양자화로 일반 CPU에서 즉시 실행 가능한 초소형 모델. 온디바이스 AI 구현 시 참고할 만한 효율적 구조.
요약
한 개발자가 250M 파라미터 규모의 언어 모델을 밑바닥부터 직접 개발하여 공개했다. 이 모델은 Fineweb 데이터셋 30B 토큰으로 학습되었으며, 2비트 이하로 양자화되어 전체 배포 크기가 60MB에 불과하다. 실행 시 약 80MB의 RAM만 필요하며, 별도의 GPU나 프레임워크 없이 일반 노트북 CPU 환경에서 초당 약 400 토큰의 빠른 추론 속도를 구현했다. 학습에 사용되지 않은 영어 웹 텍스트로 테스트한 결과, 교차 엔트로피 3.15 nats, 퍼플렉서티(Perplexity) 23.3의 성능을 기록했다. 윈도우와 리눅스를 지원하는 소형 컴파일 런타임으로 배포되며, MIT 라이선스를 통해 이용할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I developed my own quantized LLM from scratch, trained on 30B tokens, deploys in 60 MB
원문 보기 ↗