파이썬·Playwright 기반 개인용 웹 데이터 수집기 'Brawler' 구축기
웹 데이터를 JSON으로 변환하여 학습 데이터로 활용하는 파이썬 크롤링 워크플로우 예시.
요약
X 이용자 @MyWestLord가 웹사이트의 데이터를 자동으로 수집하고 분석하는 크롤러 도구인 'brawler'를 개발했다. 이 도구는 Python, Playwright, BeautifulSoup을 기반으로 하며 동적 자바스크립트까지 완벽하게 로드된 후 헤드라인, 텍스트, 메타데이터, 가격, 태그 등 핵심 데이터만을 추출한다. 메뉴나 사이드바 같은 불필요한 요소는 제외하며, asyncio를 통해 다수의 페이지를 동시에 크롤링하고 내부 링크를 따라 전체 사이트를 매핑하는 효율성을 갖췄다. 수집된 데이터는 깔끔한 JSON 형식으로 저장하거나 데이터베이스에 즉시 로드할 수 있다. 개발자는 이 도구를 코드 및 사이트 자동 모니터링, 머신러닝을 위한 데이터셋 구축 등에 활용하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @MyWestLord: My second brain grew legs and ran off to read the internet. I call it a brawler, brain + crawler. Here's what it does when it land
원문 보기 ↗