주요 출판사들이 GPTBot을 차단함에 따라 AI 학습 데이터 거버넌스의 중요성 증대
요약
주요 출판사들이 GPTBot의 접근을 차단하며 AI 학습 데이터에 대한 통제권을 강화하고 있습니다. 이는 단순한 크롤링 제한을 넘어 데이터 라이선스 및 거버넌스 중심의 새로운 데이터 환경 변화를 시사합니다.
핵심 포인트
- BBC, The Guardian 등 주요 매체의 GPTBot 차단 추세
- 웹 크롤링에서 라이선스 및 데이터 출처 관리로의 패러다임 전환
- AI 개발사들의 데이터 수집 경로 제약 및 관리 비용 증가 가능성
- robots.txt를 활용한 기술적 옵트아웃 메커니즘의 중요성 증대
주요 출판사들이 OpenAI의 GPTBot이 자신들의 보도 내용에 접근하는 것을 점점 더 제한하고 있으며, 이는 뉴스 조직이 AI 학습에 사용되는 콘텐츠에 대한 통제권을 주장하는 방식의 광범위한 변화를 나타냅니다. BBC와 The Guardian은 robots.txt 정책에서 GPTBot을 허용되지 않는 것으로 명시하고 있으며, The New York Times 또한 서비스 약관을 통해 명시적인 허가 없이 AI 학습 및 개발을 위한 스크래핑 (scraping)을 금지했습니다.
이러한 변화가 중요한 이유는 웹 크롤링 (web crawling)이 오랫동안 대규모 학습 데이터셋을 구축하는 경로였기 때문입니다. 인지도 높은 출판사들이 소스 단계에서 접근을 제한하면, AI 개발자들은 더 제약이 많고 더 명확하게 관리되는 데이터 환경에 직면하게 됩니다. 이 문제는 단순히 크롤러가 페이지를 가져올 수 있는지 여부의 문제가 아닙니다. 이는 점점 더 **권한, 라이선스 (licensing) 및 책임 있는 데이터 출처 (data provenance)**의 문제로 변하고 있습니다.
The Guardian의 공개된 robots.txt 지침은 이러한 접근 방식의 직접적인 사례를 제공합니다. 해당 파일은 GPTBot을 광범위한 봇 세트와 함께 허용하지 않도록 설정되어 있으며, 이는 출판사가 자신의 콘텐츠가 AI 학습이나 데이터 집계 (data aggregation)를 위해 스크래핑되는 것을 원하지 않음을 나타냅니다.
출판사가 차단하는 것이 변화시키는 것
Robots.txt는 웹 크롤러에게 사이트의 어느 부분에 접근할 수 있는지를 알려주는 기계 판독 가능 (machine-readable) 파일입니다. AI 관련 크롤러의 경우, 이는 실질적인 옵트아웃 (opt-out) 메커니즘이 되었습니다. 출판사들은 온라인 콘텐츠가 어떻게 재사용될 수 있는지에 대한 비공식적인 기대에 의존하기보다, 이러한 기술적 통제를 계약상의 제한 및 라이선스에 관한 논의와 결합하고 있습니다.
주요 출판사 전반에 걸쳐 기록된 조치들이 모두 동일하지는 않지만, 모두 같은 방향을 가리키고 있습니다: 출판사 콘텐츠의 무분별한 수집을 정당화하고 실행에 옮기는 것이 점점 더 어려워지고 있다는 점입니다. 일부 출판사 정책은 모델 학습에 사용되는 크롤러와 검색 (retrieval), 인덱싱 (indexing) 또는 기타 용도로 사용되는 시스템을 구분하기 때문에 이러한 차이는 중요합니다.
| 출판사 | 기록된 조치 | 관련 시사점 |
|---|---|---|
| The Guardian | robots.txt를 통해 GPTBot 및 더 광범위한 봇들의 접근을 허용하지 않음. | AI 학습 또는 데이터 집계 스크래핑 (scraping)에 대한 제한을 시사함. |
| ... |
2023년과 2024년에 걸쳐 발표된 Reuters Institute의 연구에 따르면, BBC, The New York Times, CNN, Reuters를 포함한 주요 출판사 그룹이 GPTBot 접근을 차단하기 시작한 것으로 확인되었습니다. The Guardian은 또한 ABC와 Chicago Tribune을 포함한 매체들이 유사한 조치를 취하고 있다고 보도했습니다. 이러한 조치들은 종합적으로 볼 때, 특정 출판사의 개별적인 정책 결정이라기보다 데이터 권리 통제에 대한 산업 차원의 통합이 이루어지고 있음을 나타냅니다.
OpenAI 및 기타 모델 개발자들에게 GPTBot 제한은 웹 자료를 수집할 수 있는 잠재적 경로 중 하나가 좁아짐을 의미합니다. GPTBot은 ChatGPT와 같은 모델의 학습 데이터를 수집하기 위한 OpenAI의 크롤러 (crawler)입니다. 실질적인 결과는 모든 공개 웹 콘텐츠를 AI 시스템이 사용할 수 없게 된다는 것이 아닙니다. 대신, 허용된 소스와 제한된 소스를 구분하고 데이터가 어떻게 획득되었는지 기록하는 것의 중요성이 커집니다.
이것이 왜 이제 거버넌스 (governance) 이슈인가
출판사들의 대응은 세 가지 운영상의 질문을 더욱 명확하게 부각시킵니다:
- 데이터 출처 (Data provenance): 개발 팀은 학습, 평가 및 검색 (retrieval) 데이터가 어디에서 왔는지, 그리고 수집 당시 어떤 제한 사항이 적용되었는지에 대한 방어 가능한 기록이 필요합니다.
- 라이선스 전략 (Licensing strategy): 크롤링을 통해 수집할 수 없는 콘텐츠를 조직이 학습용으로 사용하고자 하는 경우, 명시적인 허가나 라이선스 계약이 필요할 수 있습니다.
- 시스템 설계 (System design): 팀은 학습용 크롤러에 대한 정책이 검색 (retrieval), 인덱싱 (indexing) 또는 기타 AI 워크플로 (workflows)에도 동일하게 적용된다고 가정해서는 안 됩니다. 각 유스케이스 (use case)마다 별도의 검토가 필요합니다.
이러한 변화는 파운데이션 모델 (foundation models)을 구축하지 않는 기업들에게도 영향을 미칩니다. 내부 AI 도구를 개발하는 조직은 데이터 관행이 서로 다른 제약 조건을 가진 외부 데이터셋, 제3자 모델 또는 검색 시스템 (retrieval systems)을 사용할 수 있습니다. 따라서 조달 (Procurement), 법무 (legal), 보안 (security) 및 기술 팀은 어떤 콘텐츠가 어떤 조건과 목적으로 AI 워크플로 (workflow)에 유입되는지에 대해 공유된 관점을 가질 필요가 있습니다.
핵심적인 불확실성은 출판사의 제한 사항, 옵트아웃 (opt-out) 메커니즘 및 향후 라이선스 계약이 진화하는 AI 권리 프레임워크 (AI-rights frameworks) 및 집행 관행과 어떻게 일치할 것인가 하는 점입니다. 현재 가용한 증거들은 단일한 산업 표준을 확립하고 있지는 않습니다. 다만, 주요 출판사들이 기술적 및 계약적 메커니즘 모두를 통해 자신들의 선호도를 더욱 명확하게 드러내고 있다는 점은 보여줍니다.
AI 데이터 소스, 검색 아키텍처 (retrieval architectures) 또는 벤더 제어 (vendor controls)를 평가하는 조직은 데이터 출처 (data provenance)와 권한 경계를 고려한 AI 거버넌스 (AI governance), 워크플로 설계 및 구현 결정에 대해 Scalevise와 협력할 수 있습니다.
자주 묻는 질문 (Frequently Asked Questions)
GPTBot이란 무엇인가요?
GPTBot은 ChatGPT와 같은 모델을 학습시키는 데 사용되는 데이터를 수집하기 위한 OpenAI의 웹 크롤러 (web crawler)입니다.
어떤 출판사들이 GPTBot을 차단했나요?
확인된 자료에 따르면 BBC와 The Guardian이 robots.txt에 GPTBot을 허용되지 않음으로 명시하고 있습니다. Reuters Institute의 연구 또한 The New York Times, CNN, Reuters를 포함한 주요 출판사들의 차단 사례를 언급했습니다.
The New York Times는 자사 콘텐츠에 대한 AI 학습을 금지하나요?
The New York Times는 2023년 8월 서비스 약관을 업데이트하여 명시적인 허가 없이 AI 학습 및 개발을 목적으로 콘텐츠를 스크래핑 (scraping)하는 것을 금지했습니다.
robots.txt 제한 사항이 모든 AI 유스케이스 (use case)에 적용되나요?
반드시 그렇지는 않습니다. 출판사 정책은 학습용 크롤러와 검색 (retrieval), 인덱싱 (indexing) 또는 기타 봇을 구분할 수 있으므로, 각 AI 유스케이스마다 별도의 검토가 필요합니다.
GPTBot 차단이 기업 AI 팀에게 왜 중요한가요?
팀들이 데이터셋을 선택하거나, 검색 시스템 (Retrieval Systems)을 구축하거나, AI 벤더 (Vendors)를 평가할 때 데이터 출처 (Data Provenance), 권한 (Permissions) 및 라이선싱 (Licensing)의 중요성이 더욱 커집니다.
결론
BBC, The Guardian, 그리고 The New York Times의 사례는 저널리즘이 AI 개발에 사용되는 방식을 통제하려는 출판사들의 광범위한 노력을 보여줍니다. GPTBot 제한 및 관련 약관이 더욱 보편화됨에 따라, 모델 빌더 (Model Builders)와 기업 팀들은 권한, 라이선싱 및 데이터 거버넌스 (Data Governance)에 대해 더욱 엄격한 접근 방식을 갖추어야 할 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기