모든 정책을 매번 프롬프트에 넣는 대신 RAG 도입이 필요한 이유
매번 25만 토큰을 모델에 주입하는 비효율적 워크플로우에 대한 커뮤니티 검증 사례. 토큰 최적화와 RAG 구조 개선을 고민 중인 개발자에게 참고가 됨.
요약
한 서비스 업체의 왓츠앱 봇 운영자가 모든 고객 메시지에 25만 2,000 토큰에 달하는 전체 정책 세트를 무조건 포함하는 방식을 도입해 커뮤니티의 주목을 받고 있다. 이 방식은 검색(Retrieval) 과정 없이 고객의 잔액, 계약 상태, 결제 수단 등 시스템 내 약 320개의 실시간 데이터와 130개의 조건부 정책 블록을 포함한 전체 프롬프트를 매번 LLM에 전달한다. 운영자는 2만 7,000명의 고객을 대응하며 실수를 최소화하기 위해 모델이 외부 정보를 조회하지 않도록 모든 맥락을 프롬프트에 직접 주입하는 전략을 택했다. 해당 사례는 검색 증강 생성(RAG) 대신 대규모 컨텍스트 입력을 강제하는 설계가 비용과 성능 측면에서 적절한지에 대한 개발자들의 논의를 불러일으키고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Our bot reads 252,000 tokens before it answers "hi". Tell me we're doing this wrong.
원문 보기 ↗