참고팁Reddit
4.37MB 초경량 모델 'MICA': 트랜스포머 없이 정수 재작성 규칙으로 구현
기존 딥러닝 아키텍처와 다른 방식의 효율적 텍스트 예측 연구 사례. LLM 최적화 관심 개발자 참고.
요약
최근 한 개발자가 Transformer나 RNN 레이어 대신 정수 재작성 규칙(integer rewrite rules)을 사용하는 초소형 언어 모델 'MICA'를 구축했다. MICA는 전체 모델 크기가 4.37MB에 불과하며, 최근 버전의 검증 데이터셋에서 2.77 bits/byte의 성능을 달성했다. 초기 버전은 정보를 저장하는 메모리 보호가 되지 않아 4.06 bits/byte에서 정체되었으나, 메모리 보호 기능을 도입한 후 성능이 대폭 개선되었다. 모델은 텍스트를 작은 정수 격자에 저장하고, 주변 바이트를 읽어 작업 메모리에 값을 쓰는 방식으로 다음 바이트를 예측한다. 현재 MICA는 일관된 문장을 작성할 수 있는 수준은 아니지만, 이전 바이트만 예측하던 모델보다 유의미한 진전을 보이고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 MICA: my attempt at building a language model in 4.37 MB
원문 보기 ↗