GEO를 위한 설계: LLM이 정확하게 인용하는 데이터 사이트 만들기
요약
생성 엔진 최적화(GEO)를 위해 LLM이 데이터를 정확하게 인용할 수 있도록 사이트를 설계하는 전략을 다룹니다. 텍스트 구조화, 크롤러 허용, Schema.org 마크업 적용 및 JSON 엔드포인트 제공을 통해 AI 모델의 인용 가능성을 높이는 방법을 제시합니다.
핵심 포인트
- LLM 인용을 위해 명확한 사실, 출처, 구조화된 텍스트 제공 필요
- robots.txt와 llms.txt를 통해 AI 크롤러의 접근성 확보
- Schema.org 및 JSON-LD를 활용한 데이터의 의미론적 마크업 적용
- 기계가 읽기 쉬운 안정적인 JSON 엔드포인트 구축 권장
- 허브 앤 스포크 전략을 통한 엔티티 권위(Authority) 강화
전통적인 SEO는 10개의 파란색 링크(ten blue links)를 최적화합니다. GEO — 생성 엔진 최적화 (Generative Engine Optimization) — 는 누군가가 ChatGPT, Perplexity, 또는 Claude에게 당신의 데이터로 답할 수 있는 질문을 했을 때, 정확하게 인용되는 것을 최적화합니다. 두 방식은 겹치는 부분이 있지만, 후자의 경우 아직 정리된 베스트 프랙티스가 거의 없습니다. 우리가 실제로 변경한 사항은 다음과 같습니다.
독자가 모델일 때 무엇이 변하는가
LLM은 히어로 이미지(hero image)를 훑어보거나 탭을 클릭하지 않습니다. LLM은 텍스트를 흡수하며, 세 가지 요소에 보상을 줍니다: 명확하게 진술된 사실, 명확한 출처 (누가, 언제 말했는지), 그리고 형태를 망가뜨리지 않고 추출할 수 있는 구조입니다. <canvas>에 갇혀 있거나 차트 이미지로 된 수치는 보이지 않습니다. 하지만 날짜와 출처가 포함된 문장 속의 동일한 수치는 인용 가능합니다. 작업 규칙은 다음과 같습니다: 신중한 낯선 사람이 당신을 인용하더라도 여전히 내용이 맞을 수 있도록 작성하세요.
크롤러를 허용하라
AI 크롤러가 당신을 읽을 수 없다면 인용될 수 없습니다. 두 개의 파일이 대부분의 역할을 수행합니다. 명시적으로 크롤러를 허용하는 robots.txt입니다:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
...
그리고 루트(root)에 위치한 llms.txt입니다 — 이는 사이트가 무엇인지와 주요 페이지를 나타내는 일반 마크다운 (plain-Markdown) 지도로, 모델이 내비게이션 소스(nav soup)로부터 추론하는 대신 정직한 요약을 얻을 수 있게 합니다:
# Furiosa Studio — data hub
> 천문학, 축구, 역사를 아우르는 무료 소스 데이터셋.
...
사실에 마크업을 적용하라
Schema.org의 Dataset + JSON-LD는 숫자 페이지를 엔진이 속성을 부여할 수 있는 무언가로 변환합니다:
{
"@context": "https://schema.org",
"@type": "Dataset",
...
creator, dateModified, 그리고 license 필드는 엔진이 특정 수치를 인용해도 안전한지, 그리고 누구에게 공로를 돌려야 하는지를 결정할 때 사용하는 바로 그 정보입니다.
인용 표면으로서의 엔드포인트 (Endpoints)
산문(Prose)은 인간을 위한 것이고, JSON은 기계(machines)를 위한 것입니다. 모든 데이터셋은 또한 공개적이고 안정적인 JSON 엔드포인트 (endpoints)를 가집니다 (달, 일식, 팬데믹, 득점 상위자 등). 모델 — 또는 당신을 기반으로 구축하는 개발자 — 는 렌더링된 표를 스크래핑(scraping)하는 대신 가공되지 않은 수치(raw figure)를 가져오므로, 환각(hallucination)된 근사치가 아닌 당신이 게시한 수치를 인용하게 됩니다. 안정적인 URL과 문서화된 형태(shape)는 깔끔한 인용 표면(citation surface)이 됩니다.
허브 앤 스포크 (Hub and spoke)
레버리지 전략: 하나의 통합 허브(furiosadata.com)가 모든 데이터 사이트를 연결하고, 모든 사이트는 다시 허브로 연결됩니다. 검색 엔진이나 생성 엔진(generative engine)에게 이는 여덟 개의 무관한 페이지가 아니라 하나의 일관된 엔티티(entity)로 읽힙니다. 따라서 어느 한 스포크(spoke)에서 얻은 권위(authority)가 그들 모두를 끌어올립니다. 이는 포트폴리오 수준에서 적용된, 항상 효과가 있었던 내부 링크(internal-linking) 로직입니다.
우리가 다르게 할 점
GEO는 새롭고 피드백 루프(feedback loop)가 느립니다. 순위 변동을 매일 지켜보는 것이 아니라, 엔진이 몇 달에 걸쳐 당신을 인용하기 시작하는지를 지켜보는 것입니다. 두 가지 솔직한 교훈이 있습니다. 첫째, 구조화된 데이터(structured data)는 산문(prose)이 이미 사실을 명확하게 기술하고 있을 때만 도움이 됩니다. 스키마(schema)는 라벨일 뿐, 내용을 말하는 것을 대체할 수 없습니다. 둘째, llms.txt는 아직 표준(standard)이 아닌 관습(convention)이므로, 누군가 반드시 읽는다는 보장이 아닌 저렴한 보험 정도로 취급하십시오.
이것이 우리가 전체 포트폴리오를 카탈로그화하고 상호 연결하는 Furiosa Studio의 데이터 허브인 furiosadata.com을 구축한 방식입니다.
Built by Furiosa Studio.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기