추론 비용 낮추는 트리 기반 희소 어텐션 'ALHR' 프로젝트 공개
1024 토큰 기준 밀집 어텐션 대비 KV 캐시 요구량을 35배 이상 줄여 추론 효율성 개선에 활용 가능.
요약
ALHR(Adaptive Learnable Hierarchical Routing)은 정적 이진 트리와 학습 가능한 함수를 활용해 추론 시 읽어야 할 키의 양을 최소화하여 서브 쿼드라틱(sub-quadratic) 추론을 구현하는 희소 어텐션 시스템이다. MQAR 테스트(1024 토큰) 결과, ALHR은 쿼리당 평균 30개의 키를 읽어 Dense 방식(512개) 대비 약 17배 효율적인 성능을 보였으며, KV 압축률은 35.3배를 달성했다. Top-1 정확도는 Dense 방식이 94.9%, ALHR이 92.1%로 나타나 성능 손실을 최소화하면서도 효율성을 높였다. 특히 Peak VRAM 사용량이 Dense 방식은 쿼드라틱하게 증가하는 반면, ALHR은 선형적으로 확장되어 캐시 압축 측면에서 100% 효율을 기록했다. 다만 현재 ALHR은 훈련 과정에서 Dense Teacher 모델을 사용하며, 전체 학습 과정 자체는 여전히 쿼드라틱하게 동작한다는 한계점이 존재한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I built ALHR: A tree based sparse attention system that achieves sub-quadratic inference while retaining accuracy. [P]
원문 보기 ↗