상위 2,000개 사이트 중 19%가 AI 크롤러를 차단하고 있으며, 136개 사이트는 자신도 모르게 차단하고 있습니다
요약
상위 2,000개 웹사이트를 조사한 결과, 19%가 주요 AI 크롤러를 차단하고 있는 것으로 나타났습니다. 특히 많은 사이트가 개별 크롤러가 아닌 정책 차원에서 일괄 차단 방식을 택하고 있으며, 일부 사이트는 robots.txt 설정과 무관하게 기술적 계층에서 크롤러를 차단하고 있습니다.
핵심 포인트
- 상위 2,000개 사이트 중 19.1%가 주요 AI 크롤러를 차단함
- 차단 사이트의 75%는 3개 이상의 크롤러를 일괄 차단하는 경향을 보임
- 차단 여부는 사이트 규모보다 콘텐츠 카테고리에 따라 결정됨
- 136개 사이트는 robots.txt에서 허용함에도 WAF 등을 통해 실제로는 차단 중
상위 2,000개 사이트 중 19%가 AI 크롤러를 차단함
2026년 8월 2일, 나는 Tranco top-1M 리스트에서 상위 2,000개 도메인을 스캔하여 각 사이트에 한 가지 질문을 던졌다: AI 크롤러 (AI crawler)가 이 사이트를 읽을 수 있는가?
"읽어야 하는가"가 아니다. 그것은 모든 사이트가 내릴 수 있는 비즈니스 결정이다. 단지: GPTBot, ClaudeBot, PerplexityBot 또는 Google-Extended가 나타났을 때 사이트가 실제로 어떻게 동작하는가에 대한 것이다.
결과는 다음과 같다.
헤드라인
접근 가능한 robots.txt가 있는 1,530개 도메인 중, 292개(19.1%)가 4대 주요 AI 크롤러 중 최소 하나를 허용하지 않음(disallow)으로 설정했다.
| 크롤러 (Crawler) | 차단 주체 수 | 점유율 |
|---|---|---|
| GPTBot | 254 | 16.6% |
| ... | ||
| 차단하는 곳들은 당신이 예상하는 바로 그곳들이며, 전혀 숨기지 않는다: instagram.com (#11), twitter.com (#16), amazon.com (#25), pinterest.com (#51), x.com (#53), yahoo.com (#59), msn.com (#60), tiktok.com (#61). 콘텐츠 자체가 곧 제품인 소셜 및 커머스 플랫폼들이다. |
차단은 거의 전무 아니면 전부(all-or-nothing) 방식임
나는 검색 관련 크롤러는 허용하고 학습 관련 크롤러는 차단하는 식의 미묘한 차이를 예상했다. 하지만 데이터는 그렇지 않음을 보여준다.
| 차단 범위 | 사이트 수 |
|---|---|
| 4개 모두 차단 | 119 |
| ... | |
| 차단 사이트의 75%가 3개 이상의 크롤러를 차단한다. 결정은 크롤러별로 이루어지는 것이 아니라, 정책 수준에서 "AI 크롤러, 안 돼"라고 한 번에 내려진다. |
사이트가 선택적으로 차단할 때, 한 이름이 다른 이름들보다 더 많이 등장한다. 정확히 하나의 크롤러만 차단하는 35개 사이트 중, 19개 사이트가 GPTBot을 지목했다 — 이는 ClaudeBot(8), PerplexityBot(5), Google-Extended(3)를 모두 합친 것보다 많다. GPTBot은 사람들이 들어본 이름이기 때문에, 결국 파일에 포함되는 것이다.
나를 놀라게 한 발견: 순위는 차단을 예측하지 못함
상위 200개 도메인: **19.0%**가 최소 하나의 크롤러를 차단함.
샘플 내 나머지 전체: 19.1%.
의미 있는 차이는 없습니다. 저는 법무 부서가 있는 대형 퍼블리셔들은 차단하고, 롱테일(long tail) 사이트들은 기본 설정을 그대로 두는 강력한 경향성(gradient)이 나타날 것이라 예상했습니다. 하지만 데이터에 따르면 차단 여부는 규모가 아니라 _카테고리(category)_에 의해 결정됩니다. 중간 순위의 마켓플레이스는 상위 순위의 마켓플레이스처럼 행동하며, 중간 순위의 문서(docs) 사이트는 상위 순위의 문서 사이트처럼 행동합니다.
무효한 결과(Null results)도 출판할 가치가 있습니다. 이번 결과는 그럴듯했던 가설 하나를 무너뜨립니다.
격차: 136개 사이트는 robots.txt에서는 허용하지만, 에지(edge)에서 차단하는 것으로 보임
이 부분이 여러분이 주목해야 할 대목입니다.
136개 도메인(접근 가능한 robots.txt가 있는 도메인의 8.9%)은 robots.txt에서 4개의 크롤러를 모두 명시적으로 허용하고 있지만, 홈페이지 프로브(probe) 결과 해당 요청이 정책에 도달하기도 전에 차단되고 있음이 나타났습니다. WAF(Web Application Firewall) 규칙, 봇 관리(bot-management) 제품, 그리고 CDN 기본 설정은 여러분의 robots.txt를 읽지 않습니다.
해당 사이트 중에는 nytimes.com (#152), cisco.com (#243), ibm.com (#275), salesforce.com (#288), sourceforge.net (#227), unity3d.com (#120), launchpad.net (#270) 등이 포함됩니다.
이 현상이 무엇인지, 그리고 무엇이 아닌지에 대해 정확히 말씀드리고 싶습니다. 이것은 _단일 관점에서의 유저 에이전트(user-agent) 프로브_일 뿐, 확정적인 증거는 아닙니다. 속도 제한(Rate limiting), 지리적 위치, 그리고 일시적인 에지(edge) 동작 모두 동일한 신호를 만들어낼 수 있습니다. 하지만 방향성은 충분히 명확하며 중요합니다: 웹의 상당 부분에서 robots.txt와 현실이 일치하지 않으며, 사이트 소유자는 이를 가장 나중에 알게 된다는 점입니다.
만약 여러분이 허용적인 robots.txt를 작성하고 작업이 끝났다고 가정했다면 — 그 가정은 10분 정도의 검증을 거칠 가치가 있습니다.
llms.txt: 9.4%에서 발견되었으며, 개방성과 상관관계가 있음
스캔된 2,000개 도메인 중 188개(9.4%)가 llms.txt를 제공합니다. llms.txt는 robots.txt와 독립적으로 가져왔으므로, 이 백분율은 접근 가능한 하위 집합이 아닌 전체 샘플을 기준으로 한 것입니다. 이는 일반적인 웹보다 훨씬 높은 수치이며, 순위 상위권에서 기대할 수 있는 결과입니다.
더 흥미로운 점은 상관관계입니다. 차단 여부를 판단할 수 있는 1,530개 도메인으로 한정했을 때:
llms.txt가 있는 사이트: 크롤러 중 최소 하나를 차단할 확률이 8.0% (188개 중 15곳)llms.txt가 없는 사이트: 20.6% (1,342개 중 277곳)
llms.txt를 게시하는 사이트는 AI 크롤러를 차단할 가능성이 약 2.6배 낮습니다. 이것은 인과관계는 아닙니다. 아무도 파일을 추가한다고 해서 법적 입장이 바뀌지는 않습니다. 이는 일종의 지표로 해석됩니다: AI 접근에 대해 고민해 본 팀들은 이를 허용하기로 결정하는 경향이 있으며, 이 파일은 그 결정의 눈에 보이는 흔적입니다.
하지만 실질적인 시사점은 다음과 같습니다: llms.txt가 아닌 robots.txt부터 시작하세요. llms.txt는 오늘날 소비가 제한적인 신흥 관례입니다. 반면, robots.txt는 본 연구의 모든 크롤러에 의해 현재 읽히고 있습니다. 가장 부하를 많이 받는 것(load bearing)부터 수정하십시오.
방법론 및 한계점
- 소스 목록: Tranco top-1M, 스냅샷 2026-07-13. 순위별 상위 2,000개 도메인.
- 수집된 내용:
robots.txt,llms.txt및 각 크롤러의 사용자 에이전트 문자열을 포함한 홈페이지 요청 1회. 읽기 전용. 각 호스트는 실행당 한 번만 접촉되었습니다. - 스캐너: 단일 사이트 검사에 사용된 것과 동일한 공개 CLI(Command Line Interface)를 사용했으며, 워커 16개, 경과 시간 12.4분.
- 도달 가능성 (Reachability): 2,000개 중 1,530곳에서 사용 가능한
robots.txt가 반환되었습니다. 나머지 470곳은 도달 불가능하거나(unreachable), 리디렉션되었거나, robots 파일이 아닌 무언가를 제공했기 때문에
이것은 월간 시리즈의 첫 번째 달입니다. 단 한 번의 인구 조사(census)는 통계에 불과하지만, 12번의 조사는 시계열(time series)이 되며, 시계열만이 사람들이 실제로 궁금해하는 질문인 **"AI 차단이 증가하고 있는가, 아니면 감소하고 있는가?"**에 답할 수 있는 유일한 방법입니다.
두 번째 데이터 포인트는 9월에 나옵니다. 이번 스냅샷(snapshot)이 맞는지, 아니면 틀렸음이 드러날지 관계없이 저는 그 변화량(delta)을 발표할 것입니다.
귀하의 사이트를 확인해 보세요
이 글에서 한 가지만 기억하신다면 이것입니다. 8.9%의 격차는 허용적인 robots.txt가 AI 크롤러(AI crawlers)가 귀하의 사이트를 읽을 수 있다는 증거가 아님을 의미합니다. 이를 알 수 있는 유일한 방법은 외부에서 살펴보는 것입니다.
이 인구 조사에 사용된 스캐너(scanner)는 표준 라이브러리 외에 의존성(dependencies)이 없는 단일 오픈 소스(open-source) Python 파일입니다. 로컬(locally)에서 실행되므로 가입할 필요도, 이메일 인증 벽(email wall)도 없으며, 데이터가 귀하의 기기를 떠나지도 않습니다.
https://github.com/STARS-BIT-ux/ai-crawler-check
python ai_crawler_check.py yourdomain.com
이 도구는 위에서 언급한 4개의 크롤러(crawlers)와 CCBot(대부분의 오픈 데이터셋에 데이터를 공급하는 Common Crawl)을 확인하고, 귀하의 robots.txt와 llms.txt를 읽은 뒤, 각 유저 에이전트(user-agent)가 실제로 무엇을 반환받는지 출력합니다. 이번 인구 조사와 동일한 필드를 사용하므로, 귀하의 결과는 위의 수치들과 직접 비교할 수 있습니다.
만약 결과가 귀하의 robots.txt와 일치하지 않는다면, 다음 콘텐츠 게시를 하기 전에 수정해야 할 가치 있는 문제를 방금 발견하신 것입니다.
데이터 수집일: 2026-08-02. 도메인별 원시 결과(Raw per-domain results)와 실행 매니페스트(run manifest)는 요청 시 제공 가능합니다. 매니페스트에는 리스트 스냅샷(list snapshot), 워커 수(worker count), 스캐너 버전(scanner version) 및 완료 시간이 기록되어 있어, 실행 과정을 감사(audited)하거나 재현(reproduced)할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기