RAG 서비스의 '거짓 답변' 유형: 정책 문서 그대로 출력해도 논리 오류 발생하는 사례
RAG 답변 검증 시 텍스트 매칭만으로는 부족함. 정책 해석 및 추론 검증을 위한 테스트 케이스 보강 필요.
요약
최근 Reddit 커뮤니티에서 LLM이 정책 문서의 내용을 정확히 인용하고도 잘못된 판단을 내리는 사례가 공유되어 주목받고 있습니다. 해당 사례에서 챗봇은 '미개봉 상품은 30일 이내 전액 환불, 개봉 상품은 14일 이내 스토어 크레딧'이라는 정책 문구를 모두 학습했음에도, 개봉된 제품을 환불하려는 고객에게 잘못된 환불 규정을 안내했습니다. 챗봇은 단순히 정책의 일부 문장을 그대로 출력했을 뿐, 상황에 맞는 조건부 논리를 제대로 적용하지 못해 '개봉 상품'에 대해 '전액 환불'을 제공하겠다고 오답을 냈습니다. 이는 RAG(검색 증강 생성) 시스템이나 텍스트 일치 확인 방식의 평가만으로는 LLM의 추론 오류를 잡아낼 수 없음을 시사합니다. 따라서 실무자는 LLM 평가 시 단순 문구 일치 여부가 아닌, 상황별 조건부 정책 적용의 정확성을 검증하는 고도화된 테스트 케이스를 구축해야 합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Every phrase in this answer is copied from the policy doc. It's still wrong. Would your eval catch it?
원문 보기 ↗