주요 웹사이트 300곳 분석: AI 크롤러 차단 및 로봇 배제 표준의 현실
데이터 수집 파이프라인 설계 시 크롤러 차단 및 네트워크 엣지 필터링 트렌드 확인 필요.
요약
Teneo Protocol이 방문자 수 상위 300개 웹사이트의 robots.txt를 분석한 결과, 24곳이 OpenAI의 학습 크롤러를 완전히 차단하고 있으며 9곳은 검색 봇을 차단하는 것으로 나타났다. 15곳은 학습은 거부하면서도 검색용 데이터 수집은 허용하는 전략을 택하고 있어, 사이트들이 모델 학습 데이터로는 활용되지 않기를 원하지만 검색 결과 노출은 희망함을 보여준다. 그러나 robots.txt는 단순 요청일 뿐이며, 주요 AI 기업들은 사용자 질문에 따른 검색 시 이를 무시하는 경우가 많아 실무적인 대응은 네트워크 엣지 차단으로 이동하고 있다. 실제로 9월 15일부터 클라우드플레어(Cloudflare)는 광고 수익 기반 페이지에서 AI 에이전트 봇을 기본값으로 차단하기 시작했다. AI 검색은 특정 지역에서 실제로 보여지는 데이터를 필요로 하기에, 데이터 센터 발 접속을 차단하는 네트워크 수준의 제어가 향후 중요한 대응책이 될 전망이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @teneo_protocol: We checked robots.txt on the 300 most-visited websites this morning. 152 have one. 24 block OpenAI's training crawler outright. 9
원문 보기 ↗