474개의 프랑스 중소기업(SMB) 웹사이트 AI 준비도 스캔 결과: 평균 점수는 48/100
요약
프랑스 중소기업 474개 웹사이트를 대상으로 AI 준비도를 조사한 결과, 평균 점수가 48/100점에 그치는 것으로 나타났습니다. 많은 기업이 AI 크롤러를 차단하지는 않지만, 정작 AI 에이전트가 정보를 파싱하거나 작업을 수행하기에 적합한 구조적 요소를 갖추지 못한 것으로 분석되었습니다.
핵심 포인트
- 프랑스 SMB 웹사이트의 80.8%가 AI 준비도 점수 60점 미만 기록
- AI 에이전트가 작업을 수행하기 위한 구조적 신호(Semantic landmarks 등)가 매우 부족함
- llms.txt 파일을 보유한 사이트는 19.6%에 불과하며, 그중 규격을 준수하는 비율은 13.3%임
- 단순 크롤링 허용을 넘어 AI 에이전트 친화적인 AEO(AI 엔진 최적화) 전략이 필요함
데이터에서 예상치 못하게 명확하게 발견된 역설이 하나 있습니다. 프랑스의 중소기업들은 AI 크롤러 (AI crawlers)를 거의 차단하지 않지만, 정작 그들의 사이트는 크롤러가 읽을 만한 가치가 있는 정보를 거의 제공하지 않는다는 점입니다.
우리는 프랑스 웹 에이전시인 Les Créavores에서 AEO (AI Engine Optimization, AI 엔진 최적화) 스캐너를 운영하고 있으며, "AI 검색 준비도"에 대해 무엇인가를 작성하기 전에 막연한 느낌 대신 실제 수치를 확인하고 싶었습니다. 그래서 우리의 무료 스캐너의 기반이 되는 것과 동일한 감사 엔진을 프랑스 중소기업 (SMB) 웹사이트 샘플에 적용하여, AI 에이전트 (AI agent)나 크롤러 (crawler)가 파싱 (parse)할 수 있는 구조적 요소들이 실제로 무엇이 있는지 측정했습니다.
방법론 요약
- 474개 사이트 분석 (509개 수집, 35개는 분석 불가 — 데드 링크, 타임아웃이 발생하는 JS 전용 셸 등)
- 프랑스 전역의 10개 섹터 × 15개 도시
- 샘플 = Brightdata를 통해 수집된 섹터/도시 조합별 Google 로컬 검색 유기적 결과 상위 10개
- 수집 날짜: 2026-07-13
- 홈페이지 전용 감사 — 사이트 전체를 크롤링하지 않았습니다. 이는 실제 AI 가시성이나 인용 빈도가 아닌, 구조적 준비도를 측정합니다. 이들은 서로 다른 질문이며, 우리는 이 데이터셋이 두 번째 질문에 답한다고 주장하지 않습니다.
전체 데이터셋은 DOI와 함께 CC-BY 4.0 라이선스로 공개되어 있으며, 원시 수치를 직접 파헤쳐 보고 싶다면 하단의 링크를 참조하십시오.
핵심 수치
평균 준비도 점수: 48/100 (중앙값 49). 사이트의 **80.8%**가 60점 미만을 기록했습니다. **1.3%**만이 80점 이상(우리의 점수대 기준 "우수")을 기록했습니다.
하위 점수는 점수가 실제로 어디에서 누수되고 있는지를 보여줍니다:
| 하위 점수 | 평균 | 최대 |
|---|---|---|
| 크롤링 가능성 (Crawlability) | 14.9 | 30 |
| ... |
세 가지 차원 중 어느 것도 포화 상태에 가깝지 않습니다. 이는 하나의 약점이 견고한 점수를 깎아먹는 것이 아니라, 광범위하고 균등한 부족함을 나타냅니다.
에이전트 기반 탐색 (Agentic navigation)은 거의 부재함
우리는 'AI 에이전트가 이 사이트에서 실제로 작동할 수 있는가'에 대한 세 가지 기본적인 신호(signal)를 확인했습니다: 구조화된 접근성 트리(structured accessibility tree, <main>/<nav> 같은 의미론적 랜드마크와 alt 텍스트 커버리지), 사용 가능한 llms.txt 파일, 그리고 에이전트에게 진정으로 개방된 접근성(AI 봇 차단 없음, noindex 미사용, canonical 및 viewport 태그 존재). 평균 점수는 3개 항목 중 1.2점을 통과했습니다. 세 가지를 모두 통과한 사이트는 단 **5.3%**에 불과합니다.
솔직히 가장 우려되는 수치입니다. 홈페이지 내용을 요약하는 용도로는 챗봇이 읽는 것이 하나의 사용 사례(use case)일 뿐입니다. 에이전트가 사이트에서 특정 작업을 완료하려는 시도(예: 예약, 견적 받기, 전화번호 찾기)는 훨씬 더 어렵고 높은 기준이며, 거의 아무도 이 기준을 통과하지 못하고 있습니다.
llms.txt: 존재하지만 대부분 잘못됨
사이트의 **19.6%**가 llms.txt 파일을 가지고 있습니다. 신흥 관행(convention)으로 들으면 괜찮아 보이지만, 실제 준수 여부를 확인해 보면: 실제로 규격에 맞는 것은 단 **13.3%**에 불과합니다. 즉, 이 파일을 추가하려 노력한 사이트의 약 3분의 1은 형식을 충분히 잘못하여 제 기능을 하지 못할 가능성이 높습니다.
AI 봇 차단 없음
이것이 역설의 또 다른 측면입니다. robots.txt에서 AI 크롤러를 차단하는 사이트는 단 **1.3%**에 불과합니다. 무려 **85.9%**는 주요 AI 사용자 에이전트(user-agent)에 대한 제한 없이 완전히 개방된 접근성을 보여줍니다.
따라서 문은 활짝 열려 있습니다. GPTBot, ClaudeBot, PerplexityBot 등 무엇이든 들어올 수 있습니다. 문제는 접근성이 아닙니다. 일단 들어온 후에는 인용할 만한 구조화된 정보가 종종 없다는 것입니다.
구조화된 데이터 및 저작권 표시
- JSON-LD 존재: 74.7% (가장 밝은 부분—대부분의 사이트가 적어도 어떤 스키마를 시도함)
- 식별 가능한 작성자/출처(byline): 17.9%
- 기본 접근성 마커: 19.2%
네 곳 중 세 곳의 사이트는 JSON-LD를 구현했지만, '누가 이 글을 썼는지/검증했는지'에 대한 명확한 신호는 다섯 곳 중 한 곳도 채 되지 않습니다. 이는 전통적인 E-E-A-T(경험, 전문성, 권위성, 신뢰성)와 LLM이 페이지의 주장을 얼마나 자신 있게 출처를 밝히거나 신뢰할 수 있는지 모두에 중요한 요소입니다.
섹터 및 지리적 분포
가장 성과가 좋은 섹터: 컨설팅 (consulting) (평균 54.8). 가장 낮은 섹터: 레스토랑 (restaurants) (43.6). 가장 성과가 좋은 도시: 파리 (Paris) (55.8). 가장 낮은 도시: 렌 (Rennes) (43.8). 격차는 존재하지만 그리 크지는 않습니다. 어떤 섹터나 도시도 만점에 근접한 곳은 없으며, 섹터나 도시가 근본적인 상황을 크게 바꾸지는 못합니다.
트래픽의 변화는 이미 일어나고 있습니다
여기 더 작고 일화적인 데이터 포인트가 하나 있습니다. 하지만 이는 실제이며 저희의 데이터입니다. 저희 자체 사이트의 GA4(Google Analytics 4)를 보면, 지난 7일 동안 AI 어시스턴트가 Google 유기적 검색 (organic search)보다 더 많은 세션 (sessions)을 보냈습니다. Copilot (10) + Perplexity (3) + ChatGPT (2) = 15 세션, 반면 Google 유기적 검색은 6 세션이었습니다. 이는 2.5배에 달합니다.
단 하나의 사이트, 일주일간의 데이터일 뿐이므로 이를 시장 변화의 추세선으로 외삽 (extrapolate)해서는 안 됩니다. 하지만 이는 소규모 사이트들에게 이것이 순수하게 이론적인 우려 사항이 아니라는 생생한 신호입니다. 샘플에 포함된 사이트들이 이에 대해 거의 전혀 준비되지 않은 환경 속에서도, 누군가는 이미 이러한 채널을 통해 트래픽을 보내고 있습니다.
실제로 무엇을 할 수 있는가
만약 당신이 SMB 사이트를 구축하거나 유지 관리한다면, 해결책은 화려하지는 않지만 구체적입니다:
- 규격에 맞는
llms.txt를 배포하세요. 단순히 파일이 존재하는 것만으로는 부족합니다. 명세 (spec)에 맞는지 확인하세요. "파일을 추가했다"는 것이 곧 "작동한다"는 것을 의미한다고 가정하지 마십시오. - JSON-LD를 서버 사이드 렌더링 (Server-render) 하세요.
useEffect나 클라이언트 전용 하이드레이션 (hydration)을 통해 구조화된 데이터 (structured data)를 주입하지 마십시오. 많은 AI 크롤러 (crawlers)들은 Googlebot이 점점 더 그렇게 하는 방식만큼 JavaScript를 실행하지 않습니다. - 사실 관계를 주장하는 부분(가격, 전문 지식, 자격 증명 등)에 실제 저자/검토자 바이라인 (bylines)을 추가하세요. 추가 비용은 거의 들지 않지만, 전체 데이터셋에서 가장 낮은 점수를 기록한 항목 중 하나입니다.
- 인간의 눈뿐만 아니라 에이전트적 탐색 (agentic navigation)을 고려하여 설계하세요. 실제 콘텐츠 섹션과 연결된 명확한 헤딩 (headings), 발견 가능한 연락처/예약 액션, 일관된 시맨틱 마크업 (semantic markup) 등—에이전트가 추측 없이 페이지가 실제로 무엇을 제공하는지 파악할 수 있게 하는 요소들입니다.
이 중 어떤 것도 차단 (blocking)을 요구하지 않습니다. 이 샘플에서 접근성 (access) 문제는 기본적으로 존재하지 않습니다. 가독성 (readability) 문제가 핵심입니다.
링크
링크
- 전체 연구: [https://lescreavores.fr/barometre-referencement-ia-tpe-pme/]
- 데이터셋 (Zenodo DOI): [https://doi.org/10.5281/zenodo.21381109]
- 데이터셋 미러 (Figshare): [https://doi.org/10.6084/m9.figshare.32996552]
- 무료 AEO 스캐너 (본 연구에 사용된 동일 엔진): [https://lescreavores.fr/outils/audit-aeo-gratuit/]
방법론에 대한 질문은 댓글로 환영합니다 — 그리고 만약 다른 시장/샘플에서 유사한 스캔을 실행하신다면, 기꺼이 의견을 교환하고 싶습니다.
— Les Créavores 팀 작성
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기