참고팁Reddit
KV 캐시 디스크 영속화 도구 'Galahad' 베타 공개
vLLM, llama.cpp 등에서 KV 캐시를 디스크에 저장해 반복 작업의 GPU 부하를 줄이는 도구. 로컬 모델 추론 효율화에 유용.
요약
Corbenic AI가 KV 캐시를 디스크에 저장하여 요청 간 재사용을 가능하게 하는 새로운 커넥터 'Galahad'의 베타 버전을 공개했다. 이 기술은 AI 모델이 동일한 작업을 반복 수행하지 않도록 하여 GPU 사용 효율을 높이고 에이전트 재사용성을 강화하도록 설계되었다. 현재 vLLM, SGLang, llama.cpp와 호환되도록 개발되었으며, 1개의 GPU를 사용하는 비상업적 용도에는 무료로 제공될 예정이다. 개발사는 베타 단계에서 클러스터 파일럿 및 Kubernetes 환경 지원을 위한 사용자 피드백과 협업을 모집하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Built a KV connector that persists the KV cache to disk across requests and restarts , looking for feedback
원문 보기 ↗