Transformer 모델을 위한 경량 KV 캐시 관리 라이브러리 'RandKV' 공개
로컬 LLM 최적화 시 KV 캐시 효율을 개선할 수 있는 파이썬 패키지. 추론 성능 최적화 실험 시 유용.
요약
Reddit의 한 개발자가 Transformers 모델의 KV 캐시를 효율적으로 관리하기 위한 파이썬 라이브러리인 RandKV를 오픈소스로 공개했다. 이 라이브러리는 전체 프롬프트를 보호하고 최신 토큰 버퍼를 유지하며, 이전 생성 토큰을 KV 헤드별로 독립적으로 샘플링하는 랜덤 퇴거 정책을 적용한다. 설치는 'pip install randkv[transformers]' 명령어를 통해 가능하며, 절대 시퀀스 위치와 물리적 캐시 길이를 분리하여 결정론적 시드를 생성한다. 현재는 Transformers 5.16, 배치 사이즈 1, 풀 어텐션 디코더 모델 환경에서만 제한적으로 작동한다. 아직 vLLM 백엔드는 지원하지 않으며, 개발자는 Qwen3 모델을 대상으로 테스트한 결과가 기대에 미치지 못했다고 밝혔다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 RandKV: a pip-installable random KV-cache eviction policy for Transformers
원문 보기 ↗