LLM 시맨틱 캐싱의 함정: 임베딩 유사도 측정의 한계 분석
임베딩 유사도만으로는 미묘한 의미 차이를 구분하기 어려움. 시맨틱 캐싱 구현 시 정확도 저하 위험을 시사함.
요약
최근 LLM 개발자들 사이에서 LLM 호출 비용과 지연 시간을 줄이기 위해 널리 사용되는 시맨틱 캐싱(Semantic Caching)의 실효성에 의문이 제기되었습니다. 연구자가 40개의 삼중항 데이터셋을 통해 검증한 결과, 의미가 같은 패러프레이즈는 코사인 유사도 중앙값이 0.836이었으나, 답이 달라져야 하는 '근사 실패(near-miss)' 사례는 오히려 0.911로 더 높게 나타났습니다. 이는 임베딩 모델이 문장의 주제를 포착하는 데는 탁월하지만, 결정적인 답변을 바꾸는 작은 토큰 차이는 반올림 오차 수준으로 무시하기 때문입니다. 실제 실험에서 40개의 근사 실패 사례 중 33개가 패러프레이즈 중앙값보다 높은 유사도를 기록하여, 단순히 유사도에 기반한 캐싱은 위험할 수 있음이 드러났습니다. 따라서 정교한 캐싱 메커니즘을 갖추지 않은 시스템에서 무분별한 시맨틱 캐싱 도입은 지양해야 한다는 결론입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I built a semantic cache for LLM calls, measured it, and concluded most systems should not run one
원문 보기 ↗