참고Reddit
LLM 지능형 라우팅 도입의 함정: 비용과 캐싱 효율 간의 트레이드오프
단순 비용 절감을 위한 모델 라우팅이 프롬프트 캐싱 효율을 저해할 수 있음을 지적한 실무적 논의.
요약
최근 LLM 게이트웨이 서비스들이 도입 중인 '지능형 라우팅' 방식은 프롬프트 난이도에 따라 모델을 분배하여 비용을 절감하려는 전략이지만, 멀티턴 대화나 에이전트 환경에서는 효율이 낮다는 지적이 제기되었습니다. 가장 큰 문제는 모델 전환 시 프롬프트 캐싱을 활용할 수 없어 발생하는 비용 손실입니다. 에이전트의 시스템 지침이나 대화 이력 같은 고정 데이터가 매번 새로운 캐시로 처리되어 성능 저하와 비용 증가를 초래하기 때문입니다. 또한 라우팅 시 발생하는 오버헤드, 재시도 비용, 추가 토큰 생성, 그리고 예측 실패에 따른 교정 비용 등을 고려하면 실제 경제적 이점은 크지 않습니다. 실행 전 프롬프트의 난이도를 정확히 예측하는 것 자체가 어렵다는 점도 실무적 한계로 꼽힙니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Per-request LLM routing is often a false economy
원문 보기 ↗