참고팁Reddit
로컬 RAG 최적화: VRAM 소모를 줄이는 경량 'Hillock' 메모리 엔진
대규모 임베딩 대신 소형 모델로 사실만 추출해 SQLite에 저장, VRAM 점유를 최소화하는 로컬 LLM 운영 팁.
요약
최근 Ollama 커뮤니티에서 로컬 RAG 구동 시 발생하는 VRAM 부족 문제를 해결하기 위한 메모리 엔진 'Hillock'이 공개되었습니다. Hillock은 대규모 언어 모델 대신 300MB 미만의 소형 모델을 활용해 5초 이내에 문서에서 핵심 사실을 추출하며, 이를 SQLite에 저장하여 VRAM 점유를 최소화합니다. 질문 시 하이퍼디멘션 벡터 검사를 통해 관련 지식 존재 여부를 먼저 확인하고, 외부 정보일 경우 질의를 차단하여 모델의 환각 현상을 방지합니다. 또한, CLI 내장 모델 스위처를 통해 로컬에 설치된 Ollama 모델을 실시간으로 전환할 수 있습니다. 추가로 OpenAI 호환 API 서버 기능을 지원하여 기존 환경과의 연동 편의성을 높였습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Built an SQLite memory engine for Ollama that does not eat all your VRAM
원문 보기 ↗