참고팁Reddit
RAG의 함정: 문서 전처리 미흡이 낳는 조용한 실패
중복 파일과 텍스트 레이어 없는 스캔본이 RAG 성능을 저하시키는 원인. 데이터 정제 필수.
요약
RAG(검색 증강 생성) 모델의 성능은 결국 학습시키거나 참조하게 하는 데이터셋(Corpus)의 품질에 직결된다. 모델이 정확한 출처를 인용하더라도, 참조된 문서 자체가 잘못된 버전일 경우 틀린 답변을 내놓는 '조용한 실패' 현상이 발생할 수 있다. 특히 파일명만 다르고 내용은 같은 여러 버전의 문서(예: Contract_final_v2_SIGNED.pdf 등)가 혼재될 경우, 모델이 최신본이 아닌 잘못된 파일을 참조할 위험이 크다. 또한 텍스트 레이어가 없는 이미지 형태의 PDF 스캔본은 모델의 문서 이해도를 저하시키는 주요 원인이 된다. 따라서 RAG 시스템 구축 시 데이터 전처리 단계에서 중복 문서를 제거하고 텍스트 가독성을 확보하는 것이 모델 성능을 좌우하는 핵심 요소이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Your grounding is only as good as your corpus. A few things I've learned about prepping sources.
원문 보기 ↗