액센츄어·하버드 연구: 장기 에이전트 세션의 모델 라우팅으로 API 비용 20% 절감
캐시 활용 최적화 시 Opus 5보다 Fable 5.1이 저렴. 세션 초기와 서브 에이전트 전환 시점의 모델 라우팅 권장.
요약
Accenture와 하버드 연구팀은 1만 건의 실제 코딩 세션을 분석한 결과, 긴 AI 에이전트 세션에서 가장 비싼 모델이 오히려 비용 효율적일 수 있음을 증명했습니다. 세션이 길어질수록 대부분의 입력이 캐시를 통해 처리되는데, 캐시 읽기 비용이 저렴한 모델(Fable 5.1 등)을 활용하면 전체 운영 비용을 크게 절감할 수 있기 때문입니다. 연구에 따르면 51~80%의 고비용 세션에서 최적화된 모델 선택 시 비용을 낮출 수 있으며, 특히 세션 시작 단계나 서브 에이전트가 실행되는 시점 등 캐시를 새로 활용할 수 있는 구간에서 모델 전환 전략이 유효합니다. 실제 연구팀은 805K 토큰의 세션에서 모델 라우팅을 통해 비용을 0.90달러에서 0.36달러로 절감하는 등 모델 소비 비용의 13~21%를 회수했습니다. 따라서 AI 에이전트 운영 시 세션 길이에 따른 캐시 효율과 모델별 가격 구조를 고려하여 전략적으로 모델을 선택하는 것이 필수적입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @undefinedKi: If you pay for AI agents, read this paper before your next bill. The most expensive model can be the cheapest one in a long agent
원문 보기 ↗