ChatGPT가 상위 50개 뉴스 사이트를 인용할 수 있는지 확인해 보았습니다. 38곳은 보이지 않았으며, 대부분은 우연한 결과였습니다.
요약
주요 뉴스 사이트 50곳을 대상으로 AI 검색 에이전트의 인용 가능성을 테스트한 결과, 38곳이 인용 불가능한 것으로 나타났습니다. 많은 퍼블리셔가 학습 크롤러와 검색 에이전트의 차이를 인지하지 못해 잘못된 차단 설정을 하고 있습니다.
핵심 포인트
- 50개 뉴스 사이트 중 76%가 AI 검색 에이전트에 의해 인용될 수 없음
- 학습 크롤러(GPTBot)와 검색 에이전트(OAI-SearchBot)의 차이 이해 필요
- 검색 에이전트를 차단하면 AI 답변 내 링크 및 인용이 불가능함
- 많은 사이트가 학습은 허용하면서 검색 인용은 차단하는 설정 오류를 범함
3주 전 저는 AI 학습 크롤러(AI training crawlers)와 AI 검색 에이전트(AI retrieval agents)의 차이점에 대해 글을 썼습니다:
GPTBot은 모델 학습을 위한 데이터를 수집하지만, ChatGPT가 질문에 답변할 때 페이지를 _실시간(live)_으로 가져오는 것은 ChatGPT-User와 OAI-SearchBot이며, 오직 이들만이 귀하를 인용하고 링크를 걸 수 있습니다. 이들을 차단하면 Google 검색 순위가 아무리 높더라도 AI 답변에는 존재하지 않게 됩니다.
한 댓글 작성자가 이들이 서로 다른 봇이라는 사실을 깨닫지 못했다고 말했습니다. 그 말을 듣고 얼마나 많은 전문 퍼블리셔들이 이 사실을 모르고 있을지 궁금해졌습니다. 그래서 직접 측정해 보았습니다.
방법 (Method)
2026년 8월 1일, 저는 가장 큰 영어권 뉴스 및 기술 퍼블리셔 50곳을 대상으로 자동 점검을 실시했습니다. 각 사이트에 대해 다음을 수행했습니다:
robots.txt를 가져와 Google이 문서화한 robots 의미론(가장 구체적인 그룹이 승리, 가장 긴 규칙이 승리, 동률일 경우Allow가 승리)을 사용하여 경로/에 대해 15개의 AI 크롤러를 평가했습니다. 여기에는 7개의 검색 에이전트(OAI-SearchBot,ChatGPT-User,Claude-SearchBot,Claude-User,PerplexityBot,Perplexity-User,Amazonbot)와 8개의 학습 크롤러(GPTBot,ClaudeBot,CCBot,Google-Extended,Applebot-Extended,Bytespider,meta-externalagent,anthropic-ai)가 포함됩니다.- JavaScript를 실행하지 않고 홈페이지를 가져왔습니다. 검색 에이전트가 작동하는 방식이 바로 이렇기 때문입니다. 그리고 제공된 HTML에 읽을 수 있는 텍스트가 포함되어 있는지 확인했습니다.
사이트가 **인용 가능(citable)**하려면 두 가지 조건이 모두 충족되어야 합니다: 검색 에이전트가 차단되지 않았을 것, 그리고 제공된 HTML에 실제 텍스트가 있을 것. 이 도구는 제가 만든 오픈 감사 액터(open audit Actor)입니다. 4개의 사이트(NYT, Guardian, FT, Daily Mail)는 홈페이지에 봇 차단벽(bot-wall)을 설치했으므로, 이들에 대해서는 robots.txt 부분만 평가되었으며, 그것만으로도 이미 결과는 결정되었습니다.
결과 (Results)
50곳 중 38곳이 인용할 수 없습니다.
9개 사이트는 7개의 검색 에이전트(retrieval agents)를 모두 차단합니다: CNN, NBC News, USA Today, HuffPost, The Telegraph, Daily Mail, CNET, ZDNet, Mashable. 이 뉴스룸들이 무엇을 게시하든, 어떤 AI 답변도 이를 인용하거나 링크를 걸 수 없습니다.
25개 사이트는 잘못된 방향으로 차단하고 있습니다. 이들은 최소 하나 이상의 학습(training) 크롤러는 허용하면서 검색(retrieval) 에이전트는 차단합니다. 즉, 이들의 콘텐츠가 모델 학습에는 사용될 수 있지만, 독자를 다시 사이트로 돌려보내는 유일한 수단(링크가 포함된 인용)은 차단되어 있다는 의미입니다. The Verge, Wired, Ars Technica, The Atlantic, Vox, The Guardian, The Washington Post, WSJ가 모두 이 그룹에 속합니다. 이들 중 단 하나라도 의도적으로 이러한 거래를 선택했을지는 의문입니다.
5개 사이트는 단 하나의 에이전트 때문에 실패합니다. ABC News와 TechCrunch는 ChatGPT-User만 차단하며, Axios, Tom's Hardware, VentureBeat는 Amazonbot만 차단합니다. robots.txt 설정 한 줄 차이로 인용이 가능해질 수 있는 상태입니다.
3개 사이트는 문은 열려 있으나 방은 비어 있습니다. NPR, Politico, The Information는 7개의 검색 에이전트를 모두 허용하지만, 이들의 홈페이지 HTML에는 JavaScript 없이는 읽을 수 있는 텍스트가 사실상 전혀 포함되어 있지 않습니다. 검색 에이전트는 JavaScript를 실행하지 않습니다. 브라우저에서는 일반적인 페이지가 보이지만, AI 에이전트는 인용할 내용을 전혀 얻지 못합니다. 이러한 실패는 브라우저 기반의 모든 감사(audit)에서는 보이지 않습니다.
누가 가장 많이 차단되는지가 그 자체로 시사하는 바가 큽니다. PerplexityBot은 50개 사이트 중 30곳에서 차단되었고, Amazonbot은 28곳, Anthropic의 두 검색 에이전트는 24~25곳에서 차단되었습니다. 반면 OpenAI의 OAI-SearchBot은 단 14곳에서만 차단되었습니다. 이것이 바로 라이선스 계약 시대의 단면을 보여주는 수치입니다. OpenAI와 계약을 맺은 발행사들은 OpenAI의 인용 봇은 허용하고 다른 모든 봇은 차단하고 있습니다.
인용 가능한 12개 사이트: Fox News, CBS News, Business Insider, LA Times, Time, Slate, The Independent, The Daily Beast, Semafor, Engadget, Gizmodo, PCMag.
전체 표 (Full table)
Retrieval = 허용된 검색 인용 에이전트 수 (7개 중). Training = 허용된 학습 크롤러 수 (8개 중).
* = robots.txt로만 제한됨 (홈페이지가 봇에 의해 차단됨).
| 사이트 | 검색 (Retrieval) | 학습 (Training) | 인용 가능 여부 | 이유 |
|---|---|---|---|---|
| cnet.com | 0/7 | 1/8 | ❌ | robots.txt |
| ... |
솔직한 주의사항 (Caveats, honestly)
- 일부는 의도적인 것입니다. NYT는 OpenAI를 고소 중이며, 여러 퍼블리셔들이 라이선스 협상을 진행하고 있습니다. 이들에게 차단은 우연이 아닌 협상력 (leverage)입니다. 하지만 "모델 학습은 허용하되 인용은 금지한다" (25개 사이트)는 입장은 전략으로서 방어하기 어려운 입장이며, 2023년의 "AI 봇 차단" 목록을 그대로 복사한 사이트들은 아무런 협상력 없이 이러한 규칙을 그대로 물려받았습니다.
- 이것은 (2026년 8월 1일 기준) 경로
/및 홈페이지의 스냅샷입니다. 섹션에 따라 다를 수 있습니다. - "인용 가능 (Citable)"은 "실제로 인용된다"는 뜻이 아니라, 기술적으로 인용을 위해 접근 가능하다는 의미입니다.
귀하의 사이트를 확인해 보세요
브라우저와 기존 SEO 도구에서는 모두 보이지 않는 두 가지 실패 모드(failure modes)가 있습니다:
- robots.txt: 귀하의 인용 에이전트(
OAI-SearchBot,ChatGPT-User,Claude-SearchBot,Claude-User,PerplexityBot,Perplexity-User,Amazonbot)를 찾아보세요. 포괄적인 AI 차단 목록(blocklists)과 원클릭 CDN 차단 기능도 보통 이 에이전트들을 차단합니다. 5분간의 수동 확인 방법은 이전 포스트에 있습니다. - 서버 렌더링 텍스트 (Server-rendered text):
curl로 페이지를 호출하여 HTML 내에 콘텐츠가 있는지 확인하세요. 만약 JavaScript가 실행된 후에만 콘텐츠가 나타난다면, 검색 에이전트(retrieval agents)는 빈 껍데기만 보게 됩니다.
단일 사이트라면 솔직히 도구가 필요하지 않습니다. 수동 확인에 5분이면 충분합니다.
하지만 다음과 같은 경우에는 단순한 문제가 아닙니다:
- 포트폴리오를 관리하는 경우. 50개의 클라이언트 사이트를 보유한 대행사가 분기마다 50개의 robots.txt 파일을 일일이 읽을 수는 없습니다. 이번 연구 전체(50개 사이트, 두 가지 확인 절차 모두)는 약 40분 만에 자동화되어 실행되었습니다.
- 본인도 모르는 사이에 답이 바뀌는 경우. robots.txt 파일은 변합니다. CDN의 원클릭 "AI 봇 차단" 스위치 작동, CMS 업데이트, 플랫폼 재구축 등이 이에 해당합니다. Cloudflare의 관리형 robots.txt는 제가 작성하지도 않은 규칙을 제 사이트에 추가하기도 했습니다. 3월에 초록불(정상)이었던 확인 결과가, 아무도 손대지 않았음에도 6월에는 빨간불(오류)이 될 수 있습니다.
제가 SEO Health Auditor를 만든 이유가 바로 이것입니다. 이 도구는 페이지당 0.05달러부터 시작하여, 어떤 사이트 목록에 대해서도 두 가지 검사(및 정기적인 기술적 SEO (Technical SEO))를 실행하며, 정해진 일정에 따라 이전 실행 결과와 차이점(diff)을 비교합니다. 따라서 트래픽에 변화가 나타나기 전에 드리프트 (drift, 변화/이탈) 현상을 파악할 수 있습니다.
50개 사이트 전체에 대한 로우 데이터 (Raw data)는 요청 시 제공 가능하며, JSON 파일을 기꺼이 공유해 드리겠습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기