RAG 봇 웹 스크래핑 시 쿠키 배너 및 파싱 오류 해결 팁
HTML 직접 파싱 대신 Jina Reader 등을 활용해 마크다운으로 변환 시 데이터 품질 확보 가능.
요약
한 LLM 개발자가 경쟁사 웹사이트의 가격, 기능, SSO 지원 여부 등을 파악하는 사내 RAG 봇을 구축했으나, 원시 HTML을 직접 파싱하는 방식 때문에 데이터 수집에 어려움을 겪고 있다. 초기 버전은 페이지 내 쿠키 배너와 네비게이션 메뉴만을 가져오거나, 자바스크립트로 렌더링되는 가격 정보를 누락하여 잘못된 답변을 내놓는 문제가 발생했다. 개발자는 이를 해결하기 위해 다양한 스크래핑 API를 테스트 중이며, 특히 Jina Reader를 활용해 URL 앞에 접두사만 붙여 마크다운으로 변환하는 방식을 검토했다. Jina Reader는 프로토타이핑에는 유용하지만, 일부 자바스크립트 기반 페이지의 데이터를 충분히 가져오지 못하는 한계를 보였다. 이에 따라 더 정교한 데이터 추출을 위해 신뢰할 수 있는 스크래핑 도구를 추가로 모색하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 my rag bot said a competitors pricing was "accept all cookies", trying to pick a scraping api now
원문 보기 ↗