AI가 실제로 답변을 얻는 곳을 조사했습니다. 여러분의 홈페이지는 거의 중요하지 않습니다.
요약
AI 모델이 답변을 생성할 때 기업의 공식 홈페이지보다 리뷰 플랫폼, 산업 디렉토리, 포럼 등 비교 가능한 소스를 주로 인용한다는 분석 결과입니다. 따라서 기술적 SEO를 넘어 AI가 정보를 수집하는 주요 소스에 브랜드가 존재하도록 하는 전략이 필수적입니다.
핵심 포인트
- AI는 브랜드 사이트보다 비교/리뷰가 가능한 제3자 플랫폼을 선호함
- G2, Reddit, Stack Overflow 등이 주요 인용 소스로 작용함
- 기술적 SEO는 필수적이지만, 소스 존재 여부(Presence)가 더 중요함
- 엔티티 식별을 위해 sameAs를 포함한 스키마 마크업 활용 권장
지난 1년 동안 "AI에 의해 인용되는 법"에 관한 글을 읽어보셨다면, 아마도 다음과 같은 조언들의 조합이었을 것입니다: 구조화된 데이터 (structured data) 추가, 더 명확한 카피 작성, 헤딩 (headings) 수정. 모두 타당한 이야기입니다. 저희는 정확히 그런 종류의 분석을 수행하는 도구를 만들었기에, 그것이 유용할 것이라는 편향을 가지고 있습니다.
그 후 저희는 AI의 답변이 실제로 어디서 가져오는지 — 특정 카테고리에서 어시스턴트가 구매 질문에 답변할 때 인용되는 소스 유형 — 를 기록하기 시작했고, 그 데이터는 저로 하여금 우선순위의 순서를 다시 생각하게 만들었습니다.
기업의 홈페이지는 주요 소스인 경우가 거의 없었습니다.
실제 인용 혼합(citation mix)의 모습
ChatGPT, Perplexity, Gemini 또는 Claude에게 "소규모 에이전시를 위한 최고의 프로젝트 관리 도구"와 같은 질문을 하면, 모델은 (보통 웹 검색을 켠 상태로) 검색된 문서들로부터 답변을 구성합니다. 특정 카테고리에 걸쳐 해당 문서들이 무엇인지 기록해 보면 패턴이 빠르게 나타납니다. 대략 다음과 같습니다:
- 리뷰 플랫폼 (Review platforms) — G2, Capterra, Trustpilot, 카테고리별 전문 리뷰 사이트
- 산업 디렉토리 (Industry directories) — 니치 리스팅 (niche listings), "최고의 X 도구" 데이터베이스
- 편집자 선정 모음 (Editorial roundups) — "2026년 Y를 위한 최고의 X 12가지"라는 제목의 블로그 포스트
- 포럼 및 커뮤니티 (Forums and communities) — Reddit 스레드, Stack Overflow, 니치 포럼
- 브랜드 소유 사이트 (Brand-owned sites) — 보통 가장 작은 비중
정확한 혼합 비율은 카테고리에 따라 크게 다릅니다. 개발자 도구는 포럼과 GitHub 쪽으로 크게 치우치고, 지역 서비스는 리뷰 사이트와 지도 쪽으로 치우치는 식입니다. 하지만 브랜드 사이트는 일관되게 직관과는 다른, 낮은 성과를 보입니다.
순위 매기기 (ranking)가 아닌 검색 (retrieval)의 관점에서 생각하면 이는 이해가 됩니다. 모델은 _당신_에 관한 가장 권위 있는 페이지를 찾는 것이 아닙니다. 모델은 당신의 카테고리 내에서 옵션들을 비교하는 문서들을 찾고 있습니다. 당신의 홈페이지는 "우리가 최고입니다"라고 말합니다. 반면 G2의 카테고리 페이지는 "여기 리뷰와 함께 순위가 매겨진 40개의 도구가 있습니다"라고 말합니다. 비교 질문에 답변하는 데 어떤 것이 더 유용할지 짐작이 가시나요?
불편한 시사점
완벽한 기술적 SEO (Technical SEO), 결점 없는 JSON-LD, 아름답고 명확한 홈페이지를 갖추고 있더라도 답변에서 누락될 수 있습니다. 왜냐하면 그 답변이 당신이 존재하지 않는 네 가지 소스로부터 구성되었기 때문입니다.
그렇다고 해서 온페이지 (on-page) 작업이 무의미하다는 뜻은 아닙니다. 이는 작업을 필요하지만 충분하지는 않은 (necessary but not sufficient) 상태로 만들며, 당신이 일을 처리해야 하는 순서를 바꿉니다:
- 당신의 카테고리에 대한 답변이 구축되는 소스 유형들에 존재할 것 (Be present)
- 모델이 당신을 발견했을 때 당신이 무엇인지 정확히 이해할 수 있도록 파싱 가능하게(Be parseable) 만들 것
대부분의 조언은 2단계만을 독점적으로 다룹니다. 1단계는 화려하지 않고 비기술적이지만, 훨씬 더 큰 효과를 발휘합니다.
기술적인 절반 (2단계) — 실제로 도움이 되는 것
이곳은 dev.to이므로, 오늘 오후에 바로 적용할 수 있는 부분을 알려드리겠습니다.
엔티티(Entity)를 모호하지 않게 만들기
가장 레버리지가 높은 단일 마크업은 sameAs가 채워진 Organization 스키마입니다. 이는 당신의 사이트를 당신을 나타내는 다른 모든 프로필과 연결합니다. 이는 검색 시스템 (retrieval system)이 흩어져 있는 언급들이 동일한 엔티티임을 확인하는 바로 그 방식입니다:
<script type="application/ld+json">
{
"@context": "https://schema.org",
...
sameAs 배열에 무엇이 있는지 주목하세요: 리뷰 사이트와 디렉토리입니다. 당신은 실제로 인용되는 소스들과 자신을 명시적으로 연결하고 있는 것입니다.
추출되어도 살아남는 구절 작성하기
검색 (Retrieval)은 페이지가 아니라 청크 (chunks) 단위로 작동합니다. 바로 위의 세 문단을 읽어야만 의미가 통하는 문단은 나쁜 청크입니다. 하나의 질문에 답하는 독립적인 문단이 좋은 청크입니다.
실질적으로 이는 다음과 같은 의미입니다:
<!-- 나쁜 예: 유용하려면 문맥이 필요함 -->
## 작동 방식
이것은 원활하게 통합되며 이를 자동으로 처리해 줍니다.
...
두 번째 방식은 출처 표기와 함께 답변으로 직접 인용될 수 있습니다. 첫 번째 방식은 아예 인용될 수 없습니다.
FAQPage 스키마는 이를 공식화합니다. 이는 "여기에 질문이 있고, 여기에 그에 대한 독립적인 답변이 있다"라는 것을 기계가 읽을 수 있도록 선언하는 것입니다:
<script type="application/ld+json">
{
"@context": "https://schema.org",
...
원하는 크롤러(Crawler)를 차단하지 마세요
특히 스크래핑(Scraping) 공포가 확산될 때 누군가 포괄적인 규칙을 추가했다면 실수하기 쉽습니다. 여러분이 실제로 인덱싱(Indexing)되기를 원하는 AI 크롤러(GPTBot, PerplexityBot, ClaudeBot, Google-Extended 등)에 대해 robots.txt를 확인하세요. 이들을 차단하는 것은 정당한 선택이지만, 그것이 의도된 _선택_인지 아니면 남겨진 잔재인지 반드시 확인해야 합니다.
비교 페이지는 검색(Retrieval)을 유도하는 미끼입니다
인용된 문서가 주로 비교 콘텐츠라면, 여러분이 직접 통제할 수 있는 한 가지는 진정으로 유용한 비교 콘텐츠를 직접 발행하는 것입니다. 여러분이 불리한 점까지 포함한 정직한 "X vs Y" 페이지는 기능(Features) 설명 페이지보다 비교 쿼리(Query)에 대해 검색(Retrieval)될 가능성이 훨씬 높습니다. 또한 이는 여러분이 얻을 수 있는 트래픽 중 의도가 가장 높은(Highest-intent) 트래픽이 되는 경향이 있습니다.
정직한 주의사항
이 분야의 많은 콘텐츠가 과장하고 있기 때문에, 솔직하게 말할 가치가 있는 두 가지가 있습니다.
그 누구도 AI 인용(Citations)을 보장할 수 없습니다. 여러분은 검색(Retrieval)되고 이해되는 것과 상관관계가 있는 신호(Signals)를 개선할 수는 있습니다. 하지만 다음 주에 어떤 모델이 무엇을 출력할지는 통제할 수 없습니다. ChatGPT에서의 순위를 약속하며 판매하는 사람은 실현할 수 없는 것을 팔고 있는 것입니다.
이것은 움직이는 타겟(Moving target)입니다. 검색(Retrieval) 동작은 엔진마다 다르며 모델 업데이트에 따라 변화합니다. 제가 설명한 것은 스냅샷(Snapshot)이지 법칙이 아닙니다. 이 목록을 포함하여 일반적인 리스트를 신뢰하기보다는 여러분만의 카테고리를 직접 측정하세요.
자신의 카테고리를 확인하는 방법
무료 버전으로 10분이면 가능합니다: 4개의 어시스턴트(Assistant)를 각각 열고, 여러분의 카테고리에 있는 고객이 물어볼 법한 구매 관련 질문을 3~4개 던진 뒤, 어떤 도메인(Domain)이 인용되는지 기록하세요. 어떤 회사의 이름이 언급되는지가 아니라, 어떤 _도메인이 링크되는지_를 확인해야 합니다. 이를 집계해 보세요. 보통 12개 정도의 질문 내에 패턴이 나타납니다.
만약 수동으로 작업하고 싶지 않다면, Greater Than Services (제가 작업 중인 서비스)가 ChatGPT, Perplexity, Gemini, Claude에 걸쳐 해당 쿼리들을 실행하여 귀하의 특정 카테고리에 대한 소스 유형별 분석(source-type breakdown)을 제공하며, 복사해서 바로 붙여넣을 수 있는 스키마 수정(schema fixes) 코드까지 제공합니다. 회원가입 없이 무료 미리보기가 가능합니다. 하지만 위에서 설명한 수동 방식도 실제로 효과가 있으며 비용이 전혀 들지 않습니다. 이 포스트의 핵심은 도구가 아니라 발견한 사실(finding)입니다.
요약 (TL;DR)
홈페이지의 역할은 모델이 이를 마주했을 때 모호하지 않게 만드는 것입니다. 모델에 의해 마주쳐지는(encountered) 일은 주로 다른 곳에서 발생합니다. 즉, AI 답변이 실제로 구성되는 기반이 되는 리뷰 사이트, 디렉토리, 모음(roundups), 포럼 등에서 발생합니다.
마크업(markup)을 수정하세요. 그런 다음 리스트에 등록되도록 하세요.
다른 카테고리의 인용 구성(citation mix)이 어떤 모습일지 궁금하다면, 직접 수동 점검을 해보시고 발견한 내용을 댓글로 남겨주세요. 특히 개발 도구(dev-tool) 카테고리가 겉으로 보이는 것처럼 정말로 포럼 비중이 높은지 매우 궁금합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기