파이썬 기반 웹 스크래핑 자동화 도구 'scrowl' 공개
Playwright 기반으로 JS 렌더링 페이지를 구조화된 데이터로 추출하는 워크플로우를 제공합니다.
요약
X 사용자인 @MyWestLord가 개발한 웹 스크래핑 도구 'scrowl'은 Python, Playwright, BeautifulSoup을 기반으로 제작되어 인터넷 데이터를 자동으로 수집한다. 이 도구는 페이지 내 자바스크립트가 완전히 로드될 때까지 대기한 후 헤딩, 가격, 스펙 등 필요한 데이터만을 정교하게 추출하여 JSON 형식이나 데이터베이스에 저장한다. 내부 링크를 따라 중복을 피하며 사이트맵을 생성하고, asyncio를 활용해 수십 개의 페이지를 동시에 크롤링할 수 있다. 사용자는 읽을 시간이 없는 사이트의 업데이트 감시나 머신러닝 데이터셋 구축 목적으로 scrowl을 활용할 수 있다. 수집된 데이터는 Claude, Obsidian, Codex 등과 같은 도구와 연동하여 사용자의 '제2의 뇌'로 활용 가능하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @MyWestLord: I stole the owl Elon posted in 2019 and taught it to read the internet for me. It’s called scrowl. Whatever it catches goes straig
원문 보기 ↗