OAI-SearchBot과 GPTBot: 검색 접근을 학습용 크롤링과 분리하기
요약
본문은 ChatGPT 검색 가시성을 위해 OAI-SearchBot과 GPTBot의 접근 목적을 분리하여 관리하는 방법을 설명합니다. 웹사이트는 robots.txt를 수정하기 전, 어떤 콘텐츠를 공개하고 어떤 크롤링을 거부할지 정책 문서를 작성해야 합니다. 또한, 단순한 사용자 요청 성공 여부가 검색 크롤링 권한을 의미하지 않음을 강조하며, 방화벽 등 다양한 접근 경로를 점검할 것을 권고합니다.
핵심 포인트
- OAI-SearchBot(검색)과 GPTBot(학습)의 목적을 분리하여 관리해야 합니다.
- robots.txt 수정 전, 공개/비공개 콘텐츠에 대한 명확한 정책 문서를 작성하세요.
- 크롤러 접근은 robots.txt 외 방화벽 규칙 등 다양한 경로를 점검해야 합니다.
- 사용자 요청(user fetch) 성공과 검색 크롤링 권한은 별개의 문제입니다.
OAI-SearchBot과 GPTBot은 서로 다른 목적을 가지고 있습니다. 만약 귀하의 목표가 ChatGPT 검색에서의 가시성이라면, 트레이닝 크롤러에 대한 정책과는 별개로 OAI-SearchBot 접근을 검토해야 합니다. 하나를 허용한다고 해서 다른 것도 허용하는 것은 아닙니다.
OpenAI의 크롤러 문서는 이러한 제어들을 독립적으로 설명합니다. OAI-SearchBot은 ChatGPT 검색에 사용되며, GPTBot은 모델 학습을 위해 콘텐츠를 수집할 수 있습니다. 허용 규칙이나 성공적인 요청이 인용(citation)을 보장하지는 않습니다.
서면 접근 정책으로 시작하기
robots.txt를 수정하기 전에, 해당 사이트가 무엇을 허용해야 하는지 문서로 작성해 보세요.
예를 들어, 한 팀은 공개 문서는 ChatGPT 검색에서 이용 가능하게 하고 싶지만 GPTBot의 학습 크롤링은 거부하고 싶을 수 있습니다. 이것은 정책 예시일 뿐, 비공개 페이지 노출에 대한 조언은 아닙니다.
이 결정으로 커버되는 공개 섹션들을 나열하세요. 계정 페이지, 고객 데이터, 그리고 비공개 문서는 기존의 접근 제어를 유지해야 합니다. robots.txt는 인증 시스템이 아닙니다.
접근 검토를 할 때는 의도된 공개 콘텐츠가 비공개 콘텐츠를 보호하는 규칙을 약화시키지 않으면서 도달 가능하도록 만들어야 합니다.
규칙이 무엇을 말하는지 이해하기
위의 예시 정책에 대해, robots.txt 조각은 다음과 같을 수 있습니다:
User-agent: OAI-SearchBot
Allow: /
...
이 조각은 분리된 사용자 에이전트 그룹을 보여줍니다. 모든 웹사이트에 대한 완전한 설정 구성은 아닙니다.
사용하기 전에 사이트의 기존 규칙들을 검토하세요. 비공개 또는 부적절한 경로에 적용되는 제한 사항들은 유지하고, 이미 더 구체적인 그룹들이 존재하는지 확인해야 합니다. 고립된 예시만으로는 귀하의 사이트에 있는 모든 규칙을 보여줄 수 없습니다.
또한 제공되고 있는 호스트 이름(hostname)도 검사하세요. 한 호스트에 대한 규칙이 다른 호스트가 동일한 구성을 가지고 있다는 증거는 아닙니다.
robots.txt를 넘어선 요청 경로 확인하기
크롤러는 요청 경로의 다른 곳에서 차단에 직면할 수 있습니다: 방화벽 규칙, 엣지(edge) 챌린지, 오류, 또는 의도된 페이지에 도달하지 못하는 리디렉션 등이 있을 수 있습니다.
OpenAI는 검색 접근을 위해 OAI-SearchBot과 게시된 IP 범위를 허용할 것을 권장합니다. 신원을 조사할 때는 현재 공식 목록을 사용하세요. 사용자 에이전트(user-agent) 문자열만으로는 다른 사람이 복사할 수 있습니다.
엣지(edge) 설정을 관리하는 담당자에게 특정 규칙 검토를 요청하세요. 광범위한 “모든 봇 허용” 변경은 피해야 합니다.
공개 URL, 관찰된 응답, 적용 가능한 규칙, 그리고 요청을 식별하는 데 사용된 증거를 간략하게 기록해 두세요. 로그나 확인된 요청이 없다면, “크롤러 접근 확인됨(crawler access confirmed)” 대신 “확인하지 않음(not checked)”이라고 작성하세요.
사용자 가져오기(user fetch)와 검색 크롤링을 혼동하지 마세요
OpenAI는 또한 사용자가 시작한 요청에 대해 ChatGPT-User를 문서화하고 있습니다. 이 역할은 자동화된 검색 크롤링과는 다릅니다. 채팅 중에 페이지가 성공적으로 열린다고 해서 OAI-SearchBot이 해당 페이지를 크롤링할 수 있다는 것을 의미하지 않습니다.
테스트는 분리해서 진행해야 합니다. “어시스턴트가 이 URL을 가져왔다(The assistant fetched this URL)”와 “검색 크롤러가 이 섹션에 접근할 수 있다(the search crawler has access to this section)”는 서로 다른 질문에 답합니다.
이러한 주의사항은 제공업체 전반에 걸쳐 적용됩니다. Anthropic의 봇 문서에는 ClaudeBot, Claude-User, 그리고 Claude-SearchBot이 각각 다른 역할을 가지고 나열되어 있습니다. OpenAI의 이름을 클로드(Claude)용 정책에 복사하지 마세요.
완료라고 부르기 전에 변경 사항을 검증하세요
승인된 설정 변경 후에는 의도한 호스트에서 제공되는 robots.txt를 검사하세요. 대표적인 공개 페이지를 확인하고 기존의 비공개 접근이 의도대로 작동하는지 확인하세요.
다른 사람이 실제 적용된 규칙과 정책을 비교하여 검토하도록 하세요. 나중에 트래픽 조사를 할 때 맥락을 갖도록 무엇이 변경되었고 언제 변경되었는지 기록해 두세요.
그런 다음 콘텐츠로 돌아가세요. 검색 접근은 명확한 답변, 유용한 증거, 또는 독자의 질문을 해결하는 페이지를 대체할 수 없습니다.
크롤러 접근을 검토할 수 있는 하나의 조건으로 간주하고, 인용(citations)은 별도로 관찰하는 결과로 간주하세요. 이러한 구분이 기술적 수정이 지원되지 않는 마케팅 약속으로 변질되는 것을 막아줍니다.
안녕하세요, 저는 Uriel Bitton입니다. SEO, AEO, GEO에 대해 글을 쓰며 브랜드가 AI 답변에서 노출되도록 돕는 일을 하고 있습니다.
SEO 및 AI 가시성을 위해 HoneyWeRank을 탐색해 보세요.
출처 (Sources)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기