KV 캐시 8배 절감: Grouped-Query Attention(GQA) 아키텍처 원리
LLM 추론 효율화의 핵심인 KV 캐시 관리 기법 중 GQA의 작동 방식을 설명하는 유용한 기술적 가이드.
요약
최근 LLM 아키텍처 변화를 통해 KV 캐시(KV cache) 사용량을 8배까지 줄일 수 있는 효율적인 방식이 주목받고 있다. 기존 Multi-head attention(MHA)은 모든 쿼리 헤드마다 고유한 키-밸류 헤드를 생성하여 메모리 점유가 크지만, Grouped-query attention(GQA)은 여러 쿼리 헤드가 하나의 키-밸류 헤드를 공유하여 이 문제를 해결한다. 예를 들어 Llama 3 70B 모델은 8개의 쿼리 헤드당 1개의 키-밸류 헤드를 공유하는 구조를 사용하여, MHA 대비 KV 캐시와 디코딩 시 읽어야 하는 데이터 양을 8배 감소시켰다. GQA는 모델 아키텍처 자체를 변경해야 적용 가능한 방식이므로, 서빙 엔진 설정만으로 구현할 수 없다는 점에 유의해야 한다. KV 캐시 비용을 제어하는 방식은 GQA 외에도 다양하며, 실무 환경에 맞는 적절한 최적화 전략 선택이 필수적이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @_avichawla: One architectural change can cut KV cache by 8x! In standard multi-head attention, every query head gets its own key and value hea
원문 보기 ↗