← promppy_ 실시간 AI 뉴스
참고X

주요 웹사이트 300곳 분석: AI 크롤러 차단 및 로봇 배제 표준의 현실

데이터 수집 파이프라인 설계 시 크롤러 차단 및 네트워크 엣지 필터링 트렌드 확인 필요.

요약

Teneo Protocol이 방문자 수 상위 300개 웹사이트의 robots.txt를 분석한 결과, 24곳이 OpenAI의 학습 크롤러를 완전히 차단하고 있으며 9곳은 검색 봇을 차단하는 것으로 나타났다. 15곳은 학습은 거부하면서도 검색용 데이터 수집은 허용하는 전략을 택하고 있어, 사이트들이 모델 학습 데이터로는 활용되지 않기를 원하지만 검색 결과 노출은 희망함을 보여준다. 그러나 robots.txt는 단순 요청일 뿐이며, 주요 AI 기업들은 사용자 질문에 따른 검색 시 이를 무시하는 경우가 많아 실무적인 대응은 네트워크 엣지 차단으로 이동하고 있다. 실제로 9월 15일부터 클라우드플레어(Cloudflare)는 광고 수익 기반 페이지에서 AI 에이전트 봇을 기본값으로 차단하기 시작했다. AI 검색은 특정 지역에서 실제로 보여지는 데이터를 필요로 하기에, 데이터 센터 발 접속을 차단하는 네트워크 수준의 제어가 향후 중요한 대응책이 될 전망이다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @teneo_protocol: We checked robots.txt on the 300 most-visited websites this morning. 152 have one. 24 block OpenAI's training crawler outright. 9

원문 보기 ↗

광고

다음 뉴스 →

속보[속보] 미 법원, Claude 군사 기능 거부한 Anthropic 블랙리스트 지정 승인

AI 기능 제한이 정부 제재 사유가 될 수 있다는 선례. 안전장치와 군·정부 요구 충돌 주시.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스