인디 사이트를 위한 Cloudflare AI 봇 정책
요약
Cloudflare의 2026년 AI 봇 정책 업데이트에 따라 인디 개발자가 검색 가시성을 유지하면서 모델 학습 크롤링을 차단할 수 있는 구체적인 가이드를 제공합니다. 검색, 에이전트 방문, 모델 학습 크롤링을 분리하여 관리하는 전략적 접근법을 제안합니다.
핵심 포인트
- 검색, 에이전트, 학습 크롤링을 분리하여 관리할 것
- 수익화 페이지 및 독창적 콘텐츠는 모델 학습 차단 권장
- SEO 기본 원칙 준수가 AI 검색 노출에 중요함
- Cloudflare의 새로운 분류 체계를 활용한 세밀한 제어 가능
인디 사이트를 위한 Cloudflare AI 봇 정책
빠른 답변
Cloudflare의 2026년 7월 AI 봇 정책 업데이트는 소규모 사이트에 "모든 봇 차단" 또는 "모든 것을 개방"하는 것보다 더 실질적인 선택지를 제공합니다. 대부분의 인디 제품 사이트에 유용한 기본 설정은 다음과 같습니다:
allow Search (검색 허용)
limit Agent only where it helps users (사용자에게 도움이 되는 경우에만 Agent 제한)
block Training on monetized or orignal-content pages (수익화된 페이지 또는 독창적 콘텐츠 페이지에서 Training 차단)
...
세 가지 작업, 즉 검색 발견(search discovery), 사용자 지향적 Agent 방문(user-directed agent visits), 그리고 모델 학습 크롤링(model-training crawls)을 분리하십시오. 이들이 서로 섞여 있으면, 인디 사이트는 유용한 발견은 차단하면서 가치가 낮은 스크래핑(scraping)은 여전히 허용하게 될 수 있습니다.
대상
이 가이드는 Cloudflare를 사용하며 AI 검색 가시성과 콘텐츠 제어 모두에 관심이 있는 인디 개발자, 솔로 SaaS 빌더, 문서 사이트 소유자 및 소규모 발행인을 대상으로 합니다.
llms.txt 대 robots.txt에 대해서는 AI crawler decision guide에서 시작하십시오. 브라우저-Agent 웹사이트 동작에 대해서는 WebMCP security checklist를 사용하십시오.
무엇이 바뀌었으며, 왜 지금인가
Cloudflare의 업데이트된 AI 봇 제어 기능은 일반적인 AI 트래픽 동작에 대해 더 명확한 분류 체계(taxonomy)를 도입합니다:
| 동작 (Behavior) | 인디 사이트를 위한 실질적 의미 |
|---|---|
| Search (검색) | 사용자가 나중에 답을 찾을 수 있도록 콘텐츠를 수집하거나 인덱싱하는 크롤러. |
| ... |
Cloudflare는 이제 고객이 기존의 "AI 봇 차단(Block AI bots)" 설정에만 의존하는 대신 이러한 동작에 따라 조치를 취할 수 있도록 합니다. 2026년 9월 15일에 새로운 도메인에는 업데이트된 기본값이 적용됩니다: 광고가 있는 페이지에서는 Training 및 Agent 봇이 차단되고, Search는 허용된 상태로 유지되며, 검색과 학습 목적이 혼합된 크롤러는 AI-training 차단 구성에 의해 차단됩니다. 고객은 그 이전에 옵트아웃(opt out)할 수 있습니다.
Google의 AI 기능(AI features) 문서에 따르면, AI Overviews 또는 AI Mode에 나타나기 위해 추가적인 기술적 요구 사항이나 특별한 AI 스키마(AI schema), 또는 필수적인 AI 텍스트 파일(AI text file)이 필요하지 않습니다. 페이지는 인덱싱(indexable)이 가능해야 하고, 스니펫(snippets) 대상이 될 수 있어야 하며, 일반적인 SEO(검색 엔진 최적화) 기본 원칙을 준수해야 합니다.
인디 사이트를 위한 의사결정 트리
Cloudflare 설정을 변경하기 전에 다음을 사용하세요:
해당 페이지가 검색을 통해 사용자를 유입시키려는 목적입니까?
예 -> Search(검색) 허용 유지, Googlebot/Bingbot 액세스 확인, snippets 활성화 유지
아니오 -> 계속 진행
...
대부분의 인디 제품의 경우, 첫 번째 정책은 보수적이고 측정 가능해야 합니다:
| 사이트 영역 | 권장 시작 정책 | 이유 |
|---|---|---|
| 마케팅 홈페이지 | Search 허용, Agent 관찰, 콘텐츠가 매우 독창적이거나 광고 기반인 경우에만 Training 차단 | 여기서는 통제보다 발견(Discovery)이 더 중요함 |
| ... |
실질적인 설정 워크플로우
1. Search와 Training을 분리하여 유지하기
가장 흔한 실수는 "AI 봇"을 하나의 카테고리로 취급하는 것입니다. 검색 크롤러(Search crawlers)와 학습 크롤러(Training crawlers)는 가치가 다릅니다. 검색은 새로운 제품이 발견되도록 도울 수 있지만, 학습은 적절한 사용자를 다시 보내주지 않으면서 독창적인 콘텐츠를 소비할 수 있습니다.
Cloudflare가 Search, Agent, Training에 대해 행동 기반 제어(behavior-based controls)를 제공한다면, 우선 Search를 허용된 상태로 유지하세요. 그런 다음 Training을 전역적으로 차단할지, 광고 기반 또는 독창적 콘텐츠 페이지에서만 차단할지, 아니면 저위험 페이지에 대해 열어둘지를 결정하십시오.
2. AI Crawl Control을 증거로 활용하기
Cloudflare의 AI Crawl Control은 모든 플랜에서 사용할 수 있으며 크롤러 활동, 요청 패턴, robots.txt 준수 여부 및 크롤러 관리 옵션을 보여줍니다:
| 확인 사항 | 기록할 내용 |
|---|---|
| 주요 크롤러 운영자 | 실제로 사이트에 접속하고 있는 운영자가 누구인지 |
| ... |
크롤러 트래픽이 보일 때마다 정책을 강화하지 마세요. 먼저 이를 검색(search), 사용자 지향적 에이전트 작업(user-directed agent work), 학습(training), 모니터링(monitoring), 소셜 프리뷰(social preview) 또는 남용(abuse)으로 분류하십시오.
3. Google AI 기능 적격성을 평범하게 유지하기
Google의 가이드는 대부분의 "GEO" 조언보다 덜 생소합니다. AI Overviews 및 AI Mode의 경우, 일반적인 SEO (검색 엔진 최적화) 기본 원칙이 여전히 적용됩니다: 크롤링(crawling)을 허용하고, 내부 링크를 사용하며, 중요한 콘텐츠를 텍스트 형식으로 유지하고, 구조화된 데이터(structured data)가 눈에 보이는 콘텐츠와 일치하도록 하며, Search Console에서 사이트를 인증하십시오.
이는 Cloudflare 변경 사항에 대한 간단한 출시 게이트(release gate)를 생성합니다:
공개 페이지 curl 호출 -> 200
robots.txt 확인 -> 중요한 페이지에 대한 실수로 인한 차단(disallow) 없음
meta robots 확인 -> 필요한 곳에 스니펫(snippets) 허용
...
일반적인 실수
- Search, Agent, Training을 분리하기 전에 광범위한 차단을 활성화하는 것.
- 해당 크롤러가 발견(discovery) 역할도 담당하고 있는지 확인하지 않고 혼합 목적의 크롤러를 차단하는 것.
- Cloudflare 봇 정책이
robots.txt, 인증(authentication), 속도 제한(rate limits) 또는 서버 권한 부여(server authorization)를 대체한다고 가정하는 것. - 봇 규칙을 강화할 때 소셜 프리뷰(social preview), 모니터링, SEO 감사 및 접근성 크롤러를 잊어버리는 것.
llms.txt를 작성한 후 그것이 정책을 강제한다고 가정하는 것.
FAQ
인디 사이트는 모든 AI 봇을 차단해야 하나요?
보통은 아닙니다. Search는 허용하고, Agent의 동작을 관찰하며, 콘텐츠나 페이지 경제성이 정당화되는 경우에만 Training을 차단하십시오. 완전히 새로운 제품은 포괄적인 제외보다는 발견 가능성(discoverability)이 더 필요합니다.
Training을 차단하면 Google AI Overviews나 AI Mode에 영향을 주나요?
자동으로 영향을 주는 것은 아니지만, 광범위한 차단은 크롤링 가능성(crawlability)에 영향을 줄 수 있습니다. 검색 트래픽이 중요하다면 검색 크롤러와 스니펫 적격성(snippet eligibility)을 온전하게 유지하십시오.
Pay Per Crawl을 즉시 활성화해야 하나요?
미래의 옵션으로 취급하십시오. 먼저 봇 트래픽을 측정하고, 가치 있는 페이지를 보호하며, 검색 발견 기능이 작동하도록 유지한 다음, 비용을 청구하는 것이 타당한지 결정하십시오.
출처
출처
- Cloudflare Docs: AI 봇 차단 (Block AI Bots): https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/
- Cloudflare Docs: 인증된 봇 (Verified bots): https://developers.cloudflare.com/bots/concepts/bot/verified-bots/
- Cloudflare Docs: AI 크롤 제어 (AI Crawl Control): https://developers.cloudflare.com/ai-crawl-control/
- Cloudflare Blog: 고객을 위한 사이트, 규칙은 당신이 정한다: 모든 고객을 위한 새로운 AI 트래픽 옵션: https://blog.cloudflare.com/content-independence-day-ai-options/
- Google Search Central: AI 기능과 귀하의 웹사이트: https://developers.google.com/search/docs/appearance/ai-features
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기