참고팁Reddit
Ollama(올라마)용 경량 메모리 엔진 'Hillock' 공개: VRAM 점유 문제 해결
RAG 실행 시 VRAM 부족 문제를 SQLite 기반 데이터 추출로 해결. 로컬 모델 최적화에 즉시 활용 가능.
요약
Ollama 사용 시 RAG 구동으로 인한 VRAM 부족 및 모델 속도 저하 문제를 해결하기 위해 'Hillock'이라는 로컬 메모리 엔진이 개발되었습니다. Hillock은 300MB 미만의 소형 모델을 활용해 5초 내외로 문서에서 사실을 추출하며, 이를 SQLite에 저장하여 관리합니다. 질문 시 하이퍼디멘셔널 벡터 체크를 수행해 저장된 지식 범위를 벗어나는 내용은 차단함으로써 Ollama의 할루시네이션(환각)을 방지합니다. CLI를 통해 로컬에 설치된 Ollama 모델을 실시간으로 전환할 수 있는 기능을 제공합니다. 또한 8000번 포트에서 OpenAI와 호환되는 API 서버를 구동할 수 있도록 지원합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Built an SQLite memory engine for Ollama that does not eat all your VRAM
원문 보기 ↗