2026년 AI 크롤러 현실 점검: 데이터가 개발자에게 말하는 것
요약
AI 크롤러의 동작 방식과 웹 트래픽 변화에 대한 실질적인 데이터를 분석합니다. 주요 AI 봇들은 JavaScript를 실행하지 않으며, 크롤링 양에 비해 리퍼럴(유입) 비율이 매우 낮다는 점을 지적합니다.
핵심 포인트
- OpenAI, Anthropic 등 주요 AI 봇은 JavaScript를 실행하지 않음
- AI 검색 최적화를 위해 SSR 또는 SSG 도입 필수
- AI 크롤링 트래픽은 급증 중이나 실제 웹사이트 리퍼럴은 매우 낮음
- AI 개요 노출로 인해 검색 클릭률(CTR)이 급격히 하락하는 추세
- llms.txt 파일의 실제 활용도는 현재 매우 낮음
모두가 "AI 검색 최적화"에 대한 생각글을 쓰고 있습니다. 저는 수치를 원했습니다. 그래서 Cloudflare, Vercel/MERJ, Ahrefs 및 AI 제공업체들의 자체 문서에서 2025-2026년 데이터를 수집했습니다. 그중 일부는 제가 사이트를 구축하는 방식을 진심으로 바꾸어 놓았습니다. 개발자 대 개발자로서, 여기 현실 점검 결과가 있습니다.
1. AI 크롤러는 당신의 JavaScript를 실행하지 않습니다
이것이 가장 중요한 부분입니다. **5억 건 이상의 크롤러 페치 (fetches)**에 대한 Vercel/MERJ의 분석 결과, 주요 전용 AI 크롤러 중 어느 것도 JavaScript를 실행하지 않는 것으로 나타났습니다. OpenAI의 GPTBot/OAI-SearchBot/ChatGPT-User, Anthropic의 ClaudeBot, PerplexityBot, 그리고 Meta나 ByteDance의 Bytespider 모두 마찬가지입니다. 이들은 당신의 가공되지 않은 HTML을 가져가고 떠납니다. 이들은 JS 파일은 다운로드하지만(ChatGPT 페치의 약 11.5%, Claude의 약 23.8%), 이를 실행하지는 않습니다.
예외는 Google입니다. Google의 Web Rendering Service는 Search와 Gemini 전반에 걸쳐 공유되므로, Google-Extended는 Googlebot이 하는 것과 동일하게 JS를 렌더링합니다.
결론: 만약 당신의 콘텐츠가 클라이언트 측 하이드레이션 (client-side hydration) 이후에만 존재한다면, Google을 제외한 모든 AI 엔진은 빈 껍데기만 보게 됩니다.
# 봇이 무엇을 보는지 확인하기
curl -A "GPTBot" https://yoursite.com/page | grep "your headline"
만약 결과가 비어 있다면, SSR, SSG 또는 프리렌더링 (prerendering)이 필요합니다.
2. AI 크롤링 트래픽은 폭발적으로 증가하고 있지만 — 되돌려주는 것은 거의 없습니다
Cloudflare의 데이터에 따르면 AI 크롤러 활동은 전년 대비 급격히 증가했으며, GPTBot의 볼륨은 약 305% 증가하여 2025년 중반까지 **전체 크롤러 요청의 약 11.7%**에 도달했습니다. 하지만 그 크롤링의 약 86%는 실시간 검색 검색 (live search retrieval)이 아닌 모델 학습 (model training)을 위한 것입니다.
그리고 리퍼럴 (referrals)은 어떨까요? 불균형이라는 말로는 부족합니다. 측정된 크롤링 대비 리퍼럴 비율은 Anthropic의 경우 약 38,065:1, OpenAI의 경우 약 1,091:1에 달했습니다. 이들은 엄청나게 읽지만, 인용은 거의 하지 않습니다. AI 도구들은 오늘날 여전히 전체 웹 트래픽의 1% 미만만을 외부로 보냅니다.
3. SERP는 제로 클릭 (zero-click)으로 가고 있습니다
2026년 초 기준으로 Google 검색의 약 68%가 클릭 없이 종료되었으며, 상단에 AI 개요 (AI Overview)가 표시된 페이지는 클릭률 (CTR)이 약 60% 하락했습니다. "첫 페이지에 노출되는 것"의 가치는 매 분기마다 낮아지고 있으며, _인용된 출처 (the cited source)_가 되는 것의 가치는 더욱 높아지고 있습니다.
4. 데이터로 입증된, 과장된 두 가지 전략
- llms.txt: 채택률은 약 8.8배 증가했으나, 2026년 5월의 한 측정 결과에 따르면 llms.txt 파일의 97%가 요청을 전혀 받지 못했습니다. OpenAI, Anthropic, Google 모두 사이트 소유자들에게 대신
robots.txt를 참조하도록 안내하고 있습니다. 원한다면 추가하십시오. 비용이 들지 않는 정적 파일(static file)이긴 하지만, 그것이 알아서 일을 해줄 것이라고 기대하지는 마십시오. - 인용 해킹 수단으로서의 Schema/JSON-LD: 통제된 분석 결과, 콘텐츠 품질을 보정했을 때 스키마 (schema)의 존재가 AI 인용을 독립적으로 예측하지는 못하는 것으로 나타났습니다. 스키마는 여전히 리치 결과 (rich results)를 얻고 엔티티 (entities)를 명확히 하는 데 도움이 되지만, 이를 마법 같은 AI 랭킹 레버로 취급하지는 마십시오.
실제로 유의미한 변화를 만드는 것
지루하지만 지속 가능한 엔지니어링:
- 콘텐츠를 서버 사이드 렌더링 (Server-render) 하십시오 — DevTools가 아닌
curl로 확인하십시오. - 인용되기를 원하는 검색 로봇 (retrieval bots)을
robots.txt에서 허용하십시오; 반드시 차단해야 하는 것만 차단하십시오. - 답변 우선의 시맨틱 HTML (semantic HTML)을 사용하십시오 — 깔끔한 헤딩 (headings), 실제 리스트 (lists), 섹션당 직접적인 답변을 제공하십시오.
- INP를 포함한 코어 웹 바이탈 (Core Web Vitals) — 페이지가 빨라야 더 철저하게 크롤링됩니다.
이 중 어느 것도 해킹이 아닙니다. 이는 크롤링 가능한 양질의 웹 엔지니어링과 동일한 규율이며, 이것이 마케터가 아닌 개발자가 AI 가시성 (visibility)을 움직이는 주체가 되는 이유입니다. 이것은 현대적인 AI SEO의 기술적 중추이며, 전통적인 기술적 SEO (technical SEO)와 거의 완전히 겹칩니다.
당신의 JavaScript를 실행할 수 없는 크롤러를 위해 구축하십시오. 그러면 답변 엔진 (answer engines)이 다음에 무엇을 하든 준비가 된 것입니다.
출처: Cloudflare Radar, Vercel/MERJ 크롤러 연구, Ahrefs 브랜드 언급 분석, 그리고 OpenAI/Anthropic/Google 봇 문서 (2025-2026).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기