Python(파이썬) 기반 웹 크롤러 'Web Crawlony' 공개… 에이전트식 병렬 크롤링 지원
비동기(asyncio) 방식을 통해 페이지를 효율적으로 병렬 처리하는 크롤링 아키텍처 예시.
요약
X 사용자가 Python, Playwright, BeautifulSoup을 기반으로 개발한 웹 크롤러 'Web Crawlony'를 공개했다. 이 도구는 개미 군집 모델을 차용해 1개의 퀸(Queen)과 32개의 워커(Workers)로 구성된 구조로 작동한다. 워커는 병렬로 페이지를 탐색하며 JavaScript 로딩 완료를 대기한 뒤 헤딩, 텍스트, 가격 등 핵심 데이터만 추출하고, 퀸은 수집된 데이터를 JSON이나 데이터베이스 형태로 저장한다. 비동기 처리(asyncio) 방식을 통해 32개의 워커가 동시에 작업하며, 1분 25초 만에 1,284개의 페이지를 크롤링하는 성능을 보였다. 불필요한 요소는 제외하고 구조화된 데이터만 효율적으로 수집하는 것이 특징이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @MyWestLord: ONE QUEEN AND 32 WORKERS JUST STRIPPED AN ENTIRE WEBSITE TO THE BONE. Meet Web Crawlony. It's a web crawler I built in Python on t
원문 보기 ↗