LLM 서빙 속도 개선이 안 되는 이유: 컴퓨팅이 아닌 '메모리 대역폭'의 한계
GPU 업그레이드 후에도 추론 속도가 정체되는 이유 설명. 메모리 병목 현상과 최적화(Flash/Paged Attention) 필요성 이해에 도움.
요약
A100에서 H100으로 GPU를 교체했음에도 LLM 토큰 생성 속도가 크게 개선되지 않는 이유는 연산 성능이 아닌 메모리 대역폭 문제이기 때문입니다. LLM 토큰 생성 과정은 매번 모델 가중치와 KV 캐시를 메모리에서 읽어와야 하는데, GPU의 연산 속도보다 메모리에서 데이터를 가져오는 속도가 훨씬 느려 병목 현상이 발생합니다. 이를 해결하기 위해 가장 중요한 최적화 방식은 Flash Attention으로 연산 중간 과정을 온칩 SRAM에서 처리하여 HBM 접근을 최소화하는 것입니다. 또한 Paged Attention은 OS의 가상 메모리 개념을 도입해 KV 캐시의 메모리 낭비를 기존 60~80%에서 4% 미만으로 대폭 줄입니다. 이외에도 Continuous Batching을 통해 GPU 유휴 시간을 제거하고, Speculative Decoding으로 작은 모델이 생성한 토큰을 큰 모델이 검증하는 방식으로 속도를 높일 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @_avichawla: A tricky LLM interview question: You're serving an LLM in FP16 on an A100. Token generation is quite slow so you upgrade to an H10
원문 보기 ↗