Google은 llms.txt는 아무 효과가 없다고 말했습니다. 제가 137,210개 도메인이 실제로 받은 것을 확인해봤습니다.
요약
본 기사는 웹사이트의 llms.txt 파일에 대한 상반된 정보를 분석합니다. Google은 공식적으로 해당 파일이 생성형 AI 검색 최적화에 필수적이지 않다고 밝혔으나, Chrome 팀은 에이전트 브라우징 감사 시 이를 포함하고 있습니다. 필자는 137,210개 도메인 데이터를 분석한 결과, llms.txt를 가진 사이트의 대부분(97%)이 실제 트래픽을 받지 못했음을 밝히며 경고합니다.
핵심 포인트
- Google은 공식적으로 llms.txt가 생성형 AI 검색에 필수적이지 않다고 명시했습니다.
- Chrome 팀은 에이전트 브라우징 감사 시 이 파일을 사용하며, 이는 개발자 문서 파싱을 위한 임시 방편으로 설명됩니다.
- 137,210개 도메인 분석 결과, llms.txt를 가진 사이트의 97%는 실제 트래픽을 받지 못했습니다.
- llms.txt로 들어오는 요청은 대부분 봇에서 발생하며, 특히 AI 도구에서 많이 확인됩니다.
llms.txt 파일은 귀하의 웹사이트와 AI 검색 엔진 사이의 다리 역할을 해야 했습니다. 루트 디렉터리에 있는 마크다운(markdown) 파일로, 최고의 페이지 목록을 선별한 것이며, 부풀려진 HTML에 어려움을 겪는 모델들을 위한 깔끔한 지도입니다. 이것을 추가하면 ChatGPT, Perplexity, Google AI Overviews가 마침내 귀하를 찾아낼 것입니다.
저도 그렇게 믿고 싶었습니다. 저는 llms.txt 존재 여부를 신호 중 하나로 확인하는 오픈 소스 GEO 감사 도구를 만들었습니다. 그러자 데이터가 들어왔는데, 그것은 체크리스트 기사들이 말하는 것과는 다릅니다.
Google이 말한 것들
2026년 5월, Google은 검색에서 생성형 AI 기능 최적화에 대한 공식 가이드를 발표했습니다. 이 가이드에는 신화 해명(mythbusting) 섹션이 있습니다. llms.txt 및 유사 파일에 대해 다음과 같이 언급합니다:
생성형 AI 검색에 나타나기 위해 새로운 기계가 읽을 수 있는 파일, AI 텍스트 파일, 마크업 또는 Markdown을 만들 필요는 없습니다.
Google의 John Mueller은 이 내용이 문서에 올라오기 전부터 일 년 넘게 말해왔습니다. 2025년 4월, Reddit에서 질문에 답하며, 그는 명확하게 말했습니다:
Google의 llms.txt 가이드라인과 Ahrefs 데이터 분석
검색 가이드가 모든 사람에게 더 이상 방해하지 말라고 알려지기 10일 전, Google Chrome 팀은 실험적인 에이전트 브라우징(Agentic Browsing) 감사(audits)의 일환으로 llms.txt를 Lighthouse에 포함했습니다. 2026년 5월 5일자로 마지막 업데이트된 이 문서는 다음과 같이 명시하고 있습니다:
이 파일이 없으면, 에이전트가 사이트의 높은 수준 구조와 주요 콘텐츠를 이해하기 위해 더 많은 시간을 크롤링하는 데 사용할 수 있습니다.
같은 회사 내 두 팀이 서로 반대 방향을 가리키고 있습니다. 모렐(Mueller)에게 모순점에 대해 질문했을 때 그는 llms.txt는 "검색용으로 완성된 것이 아니다"라고 설명했습니다. 그는 이것을 AI 코딩 도구가 개발자 문서를 파싱하기 위한 "임시 방편이며, 토큰을 절약하는 데 도움이 될 수 있는 것"이라고 불렀습니다. 비개발자 사이트가 필요로 하는 것은 아니라는 것입니다.
그렇다면 어느 쪽이 맞을까요? 저는 데이터를 확인했습니다.
연구 1: Ahrefs, 137,210개 도메인
Ahrefs는 2026년 6월 15일 역대 최대 규모의 접근성 연구를 발표했습니다. 그들은 Ahrefs Web Analytics에서 2026년 5월에 트래픽을 받은 모든 도메인을 살펴보고, 각 루트 디렉터리가 HTTP 200 응답을 반환하는 llms.txt 파일을 가지고 있는지 확인했습니다.
수치는 다음과 같습니다:
- 137,210개 도메인의 **28%**가 llms.txt 파일을 게시합니다 (약 38,000개 사이트).
- 이 파일들 중 **97%**는 2026년 5월에 트래픽을 받지 못했습니다. 아무것도 그것들을 가져가지 않았습니다. AI 봇도, 일반 크롤러도, 사람도 아니었습니다.
- llms.txt 파일에 도달한 요청의 **96%**는 봇에서 왔습니다.
- 이 봇 가져오기 중 **19.5%**는 이름이 지정된 AI 도구에서 나왔습니다. GPTBot이 가장 먼저였고, Claude-Code가 두 번째였습니다. 둘 다 답변 엔진이 아니라 학습 크롤러 및 코딩 에이전트입니다.
- llms.txt 파일이 존재하지 않았을 때 AI 봇으로부터 온 요청은 0건이었습니다. AI 봇은 결코 찾아다니지 않습니다.
마지막 요점이 모델이 질문에 답하기 전에 사용자의 파일을 "확인하는"이라는 정신적 모델을 무너뜨립니다. 실제로 그렇지 않습니다. 그것은 검색 단계에서 이미 표면화된 모든 URL(일반적으로 HTML)을 가져올 뿐입니다.
Ahrefs는 또한 불안한 점을 발견했습니다. 데이터셋에서 가장 큰 단일 리서치 크롤러가 자신을 prompt-injection-survey/1.0으로 식별했습니다. 누군가가 AI 에이전트가 파일의 내용을 수용하고 신뢰하도록 설계되었기 때문에, llms.txt를 프롬프트 주입(prompt injection) 벡터로 체계적으로 연구하고 있는 것입니다.
Study 2: SE Ranking, 30만 개 도메인
SE Ranking은 거의 30만 개의 도메인을 대상으로 별도의 분석을 수행했습니다. 그들은 llms.txt 파일의 존재 여부가 해당 도메인이 AI 시스템으로부터 인용되는 빈도와 상관관계가 있는지 테스트했습니다.
상관관계는 없습니다.
그들은 통계적 상관관계(Spearman)와 머신러닝(SHAP 분석을 사용한 XGBoost)를 모두 사용했습니다. 결과: llms.txt 변수를 모델에서 제거하는 것이 예측 정확도를 향상시켰습니다. 이 파일은 약한 신호가 아니었습니다. 노이즈였습니다.
채택률은 데이터셋 전체에서 10.13%로, 대략 10개 사이트 중 1개 수준입니다. 주요 AI 플랫폼 중 어느 곳도 공개적으로 이를 읽겠다고 약속한 바 없습니다.
Study 3: OtterlyAI, 90일 서버 로그 실험
OtterlyAI는 90일에 걸쳐 통제된 실험을 수행했습니다. 그들은 테스트 웹사이트의 루트 디렉터리에 올바르게 구현된 llms.txt 파일을 배치하고 AI 봇 트래픽을 모니터링했습니다.
- 90일 동안 사이트에 총 62,100개 이상의 AI 봇 방문이 있었습니다.
- 그 중 84건의 방문이 /llms.txt를 목표로 했습니다.
- 이는 AI 봇 트래픽의 **0.1%**에 불과합니다.
- 해당 사이트의 평균 콘텐츠 페이지는 같은 기간 동안 약 265회의 AI 봇 방문을 받았습니다. 전용 AI 파일은 임의 페이지보다 3배나 성능이 떨어졌습니다.
그들은 또한 llms.txt가
LLMs 검색 최적화 파일 llms.txt, 정말 효과가 있을까?
Limy's analysis는 이 질문에 대해 제가 본 가장 큰 데이터셋입니다. 그들은 추적하는 브랜드 전반에 걸쳐 90일 동안 515,382,577건의 AI 봇 트래픽 이벤트를 모니터링했습니다.
- 408개의 요청이 /llms.txt를 직접 겨냥했습니다.
- 5억 1천 5백만 건 중입니다.
- 이는 전체 AI 크롤러 트래픽의 0.00008%에 불과합니다.
그들이 이 공유 비율에 대해 언급한 단어는 "통계적으로 무시할 만하다(statistically negligible)"였습니다. AI 검색 가시성에 중요한 역할을 하는 봇들(GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended)은 압도적으로 해당 파일을 건너뛰고 HTML을 직접 크롤링합니다.
실제로 효과적인 것 (동일한 연구에 따르면)
이 연구들은 "아무것도 하지 말라"고 말하지 않습니다. 그들은 "다르게 무언가를 하라"고 말합니다.
Google 자체 가이드라인은 무엇이 중요한지 명확하게 제시하고 있습니다: 가치 있고, 범용적이지 않은 콘텐츠를 만드세요. AI가 스스로 당신의 기사를 작성할 수 있다면, 결코 인용하지 않을 것입니다. 이미 답을 가지고 있기 때문입니다. 이 가이드라인은 1차 경험(first-hand experience), 고유 데이터, 독창적인 분석을 콘텐츠의 가치를 높이는 신호로 지적합니다.
Ahrefs 연구는 llms.txt를 가져가는 봇들이 개발자 문서를 읽는 코딩 에이전트라고 지적합니다. 만약 당신의 사이트가 API 문서나 SDK 레퍼런스라면, 깨끗한 llms.txt는 실제로 도움이 됩니다. 하지만 블로그, 전자상거래 스토어 또는 랜딩 페이지인 경우, 어떤 에이전트도 재미로 당신의 페이지를 파싱하지 않습니다. 이 파일은 텅 빈 방을 가리키는 것과 같습니다.
Aggarwal 외 연구진(KDD 2024)이 발표한 동료 검토 논문에 따르면, 변화를 가져오는 것은 콘텐츠 수준의 편집입니다: 신뢰할 수 있는 출처에 인용 부호를 추가하거나, 통계를 추가하거나, 인용문을 추가하는 것입니다. 그들의 벤치마크는 이러한 방법들이 생성형 엔진 응답(generative engine responses)에서 가시성을 최대 40%까지 높일 수 있음을 보여주었습니다. 이것이 '효과 크기(effect size)'입니다. llms.txt에는 측정된 효과 크기가 없습니다.
제가 직접 만든 도구로 한 일
저는 GitHub에서 1,000개 이상의 별을 받은 오픈 소스 Answer Engine Optimization 감사 도구인 geo-optimizer-skill을 유지 관리하고 있습니다. 이 도구는 신호(signals) 중 llms.txt를 확인하며, 저는 이 점검 기능을 계속 유지할 것입니다.
하지만 저는 검사 기준을 변경했습니다. 이 파일이 있다고 해서 사이트 점수가 높아지는 것은 아닙니다. 단지 파일의 존재 여부를 표시하고 다음으로 넘어갈 뿐입니다. 실제로 점수에 영향을 미치는 신호는 증거가 있는 것들, 즉 크롤링 가능성(crawlability), 의미론적 구조(semantic structure), 콘텐츠 밀도(content density), 인용할 만한 구절(citation-worthy passages), 그리고 JavaScript를 실행하지 않는 봇을 위해 페이지가 렌더링되는지 여부입니다.
llms.txt는 20분짜리, 위험 부담 없는 도박과 같습니다. 원한다면 배포하세요. 하지만 이를 순위 결정 요소로 로드맵에 넣거나, 누군가에게 '최적화'하도록 돈을 지불하거나, 실제로 증거가 있는 작업들을 대체하게 두지 마십시오.
핵심 요약
137,210개 도메인, 300,000개 도메인, 62,100건의 봇 방문, 그리고 5억 1,500만 건의 봇 이벤트를 다룬 네 가지 독립적인 연구는 모두 같은 말을 합니다. Google의 공식 문서는 같은 말을 하고 있습니다. John Mueller도 일 년 전에 같은 말을 했습니다.
llms.txt는 AI 가시성 전술이 아닙니다. 이는 SEO 도구로 잘못 판매된 개발자 문서화 도구입니다. 이와 관련된 실망감은 바로 그 단일한 카테고리 오류에서 비롯됩니다.
만약 누군가 llms.txt를 AI 가시성 전술로 판매하고 있다면, 증거는 그들의 편이 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기