AI 학습 데이터용 웹 스크래핑: 준수 가이드
요약
AI 학습 및 RAG를 위한 웹 스크래핑 시 준수해야 할 법적 가이드와 데이터 거버넌스 전략을 다룹니다. 무차별 크롤링 대신 출처(provenance)가 명확하고 라이선스가 확보된 깨끗한 데이터셋 구축의 중요성을 강조합니다.
핵심 포인트
- 단순 크롤링보다 출처와 라이선스가 포함된 데이터 거버넌스가 핵심임
- 이용 약관(ToS)만으로는 공개 데이터 스크래핑을 완전히 막기 어려움
- 저작권, 개인정보, 봇 방지 통제 회피 등 다양한 법적 리스크 존재
- 구조화된 API를 활용하면 데이터 수집 및 출처 관리가 용이함
핵심 요약
- 대부분의 AI 팀은 전체 웹을 크롤링할 필요가 없습니다. 대신, 모든 행에 출처(provenance)를 유지하는 특정 플랫폼의 깨끗하고 잘 소싱된 기록이 필요합니다.
- 법적 위험은 한 가지가 아닙니다. 공개 사실을 읽는 것이 가장 방어하기 쉽지만, 저작권 보호 자료로 학습하거나, 봇 방지 통제 회피(DMCA §1201), 개인 데이터를 수집하는 것은 각각 별도의 노출을 추가합니다.
- 서비스 약관만으로는 공개 데이터 스크래핑에 취약하며 (X Corp. v. Bright Data), robots.txt는 잠금이 아니라 요청일 뿐입니다. 그러나 기계가 읽을 수 있는 옵트아웃(opt-out)을 무시하는 것은 선의를 주장하기 어렵게 만듭니다.
- 거버넌스(Governance)가 진짜 작업입니다: 모든 행에 출처(source, timestamp, license, opt-out), 데이터 시트(datasheet), 그리고 보존 한계(retention limits)가 필요합니다. 이 데이터셋을 방어해야 할 무언가로 취급하세요.
- 구조화된 API는 이 모든 것을 더 쉽게 만듭니다: 문서화된 JSON, 내장된 출처 컨텍스트, 공개 데이터에 초점, 그리고 사이트별 파서(parser)가 필요 없습니다.
AI 학습 데이터 및 RAG를 위한 웹 스크래핑은 무차별 크롤링보다는 방어할 수 있는 깨끗하고 잘 거버넌스 된 기록을 소싱하는 것에 가깝습니다. 데이터를 가져오는 것은 쉬운 부분이며, 라이선싱, 출처(provenance), 저작권, 개인 데이터가 프로젝트를 곤란하게 만드는 지점입니다. 이 가이드는 2026년에 법원이 실제로 무엇을 말하는지, 실용적인 준수 체크리스트, 데이터셋 거버넌스 방법, 그리고 구조화된 API가 모든 것을 어떻게 더 쉽게 만드는지를 다룹니다. (이는 법적 조언이 아닙니다 — 사용 목적에 대해 자문을 받으세요.)
여기서 '학습 데이터(training data)'란 무엇을 의미하는지
두 가지 인접한 필요성이 하나로 묶여 있습니다:
- RAG / 검색 (retrieval) — 어시스턴트가 답변의 근거를 마련할 수 있도록 색인화되는 현재의 구조화된 기록. 최신성(Freshness)과 출처(provenance)가 가장 중요합니다. RAG용 웹 데이터 사용 사례를 참고하세요.
- 학습 / 미세 조정(fine-tuning) / 평가 (evaluation) — 모델을 학습시키거나 측정하는 데 사용되는 큐레이션된 데이터셋. 라이선싱, 중복 제거(dedupe), 그리고 문서화가 가장 중요합니다.
두 경우 모두 얻고자 하는 결과는 동일합니다. 즉, 가공되지 않은 HTML의 더미가 아니라, **출처 컨텍스트(source context)가 포함된 깨끗한 레코드(clean records)**를 확보하는 것입니다.
법원이 실제로 말하는 것 (2026)
이 분야는 현재 기술법(tech law)에서 가장 활발하게 소송이 진행되는 영역이며, 법원들의 판결도 갈리고 있습니다. 하지만 헤드라인이 시사하는 것보다 몇 가지 실마리는 더 명확합니다.
-
이용 약관(Terms of Service)만으로는 공개 데이터 스크래핑에 대응하기에 역부족입니다. X Corp. v. Bright Data Ltd. (N.D. Cal., 2024) 사건에서 법원은 X의 계약 위반 주장을 기각했습니다. 법원은 플랫폼이 아닌 X의 _사용자(users)_가 자신의 게시물에 대한 소유권을 가진다고 판단했으며, 따라서 플랫폼이 이용 약관(ToS)을 사용하여 공개 콘텐츠에 대해 "사적인 저작권 시스템(private copyright system)"을 구축할 수는 없다고 논거를 제시했습니다. 법원은 공개 데이터를 어디까지 복제할 수 있는지는 이용 약관(ToS)이 아니라 저작권법(Copyright Act)의 지배를 받는다고 밝혔습니다.
-
하지만 안티 봇(anti-bot) 제어 장치를 우회하는 것은 별개의, 더 위험한 행위입니다. 최근의 소송들은 공개 페이지를 읽는 것보다는 _우회(circumvention)_를 겨냥하고 있습니다. Reddit v. Perplexity AI (2025년 말 제기, 2026년 계류 중) 소송은 속도 제한(rate limits) 및 안티 봇 시스템을 회피한 것에 대해 DMCA §1201 위반을 주장합니다. 이는 2026년 Reddit이 인증되지 않은
.json접근을 차단한 사례의 배경이 된 것과 동일한 집행 추진력입니다. CAPTCHA와 속도 제한을 조용히 무력화하는 것은 공개 페이지를 읽는 것과는 법적으로 구별됩니다. -
robots.txt는 요청 사항일 뿐, 잠금 장치가 아닙니다. OpenAI와 관련된 소송에서 법원은 robots.txt가 DMCA 목적상의 접근을 "효과적으로 제어(effectively control)"하지는 않는다고 판단했습니다. 즉, robots.txt는 선호도를 나타내는 신호일 뿐, 기술적 장벽을 생성하는 것은 아닙니다. 이를 무시하는 것이 자동으로 "우회(circumvention)"가 되는 것은 아니지만, 여전히 약관을 위반할 수 있으며 선의(good-faith)를 주장하는 논거를 약화시킬 수 있습니다.
-
저작권이 있는 저작물로 학습하는 것은 여전히 저작권 문제를 수반합니다. 생성형 AI(generative AI)에 관한 미국 저작권청(U.S. Copyright Office)의 2025년 보고서는 저작권이 있는 저작물로부터 학습 세트를 구성하는 것이 "복제권(right of reproduction)을 명백히 침해한다"고 결론지었습니다. 따라서 공정 이용(fair use)은 _주장해야 할 방어 논리(defense to argue)_이지 보장된 권리가 아니며, 그 결과는 법원마다 확정되지 않은 상태입니다.
-
개인정보(Personal data)는 별개의 트랙입니다. Bright Data 법원은 개인정보 보호 청구(privacy claims)가 저작권에 의해 선점(preempted)되지 않는다고 언급했습니다. 따라서 저작권 방어가 가능한 경우라 하더라도, GDPR 및 CCPA는 이름, 이메일, 프로필 스크래핑을 독립적으로 제한합니다.
핵심 요점: 공개된 사실적 데이터(factual data)를 읽는 것이 가장 방어 가능한 입장입니다. 저작권이 있는 저작물로 학습하는 것, 안티 봇(anti-bot) 제어를 우회하는 것, 그리고 개인정보를 수집하는 것은 각각 고유하고 별개의 리스크를 추가합니다.
준수 체크리스트 (The compliance checklist)
- 라이선스 및 약관(Licensing & terms) — 사용 전, 특히 학습이나 재배포를 목적으로 하는 경우 각 소스의 약관과 데이터셋 라이선스를 확인하십시오.
- 우회 금지(Don't circumvent) — 속도 제한(rate limits), CAPTCHA, 또는 안티 봇(anti-bot) 시스템을 우회하는 것은 공개된 페이지를 읽는 것과는 별개인 별도의 법적 리스크(DMCA §1201)를 수반합니다.
- 거부 신호(Opt-out signals) — robots.txt, ai.txt, 그리고 기계 판독 가능한 TDM/'noai' 예약 사항을 준수하십시오. 차단(block) 신호는 거부로 간주하십시오.
- 저작권(Copyright) — 사실(가격, 통계 등)은 저작권 보호 대상이 아니지만, 기사, 사진, 설명은 저작권 보호 대상입니다. 학습을 위해 저작권이 있는 저작물을 사용하는 것은 복제(reproduction) 문제를 야기하며, 공정 이용(fair use) 여부는 아직 확정되지 않았습니다.
- 개인정보(Personal data) — 이름, 이메일, 프로필은 GDPR/CCPA에 따른 개인 식별 정보(PII)이며 저작권 판결에 의해 보호받지 않습니다. 법적 근거 없이 이를 수집하는 것을 피하십시오.
- 출처(Provenance) — 모든 레코드에 대해 소스 URL, 수집 시간, 라이선스 근거, 거부(opt-out) 상태를 기록하고, 감사가 가능한 저장소에 보관하십시오.
- 중복 제거 및 문서화(Dedupe & document) — 중복을 제거하고 데이터시트(datasheet)(출처, 날짜, 필드, 라이선스, 알려진 공백 등)를 작성하십시오.
이 내용은 실무적인 요약일 뿐 법적 조언이 아닙니다. 2026년에 웹 스크래핑은 합법인가를 참조하고, 학습 또는 재배포를 위해서는 법률 자문을 구하십시오.
데이터셋 거버넌스: 출처, 데이터시트 및 역할
RAG 인덱스를 구축하든 학습 세트를 구축하든, 데이터셋을 나중에 방어해야 할 수도 있는 대상으로 취급하십시오. 모범 사례는 몇 가지 습관으로 수렴됩니다:
- 모든 행에 출처(Provenance) 기록. 소스 URL 또는 식별자, 수집 타임스탬프(fetch timestamp), 요청 파라미터(request parameters), 라이선스/약관 근거, 그리고 모든 옵트아웃(opt-out) 상태를 기록하십시오. 이상적으로는 감사 추적(audit trail) 기능이 있는 추가 전용(append-only, 불변) 저장소에 기록하여, 어떤 행이 어디에서 왔는지 증명할 수 있어야 합니다.
- 데이터셋을 위한 데이터시트(Datasheet). 누군가 데이터로 학습을 시작하기 전에, 출처, 날짜, 필드, 수집 방법, 알려진 공백(gaps), 라이선스 관련 참고 사항을 문서화하십시오. 이는 "데이터셋을 위한 데이터시트(Datasheets for Datasets)" 패턴을 따르는 것입니다.
- 기계 판독 가능한 옵트아웃(machine-readable opt-outs) 준수. EU DSM 지침(EU DSM Directive)의 텍스트 및 데이터 마이닝(TDM) 예외 조항(제4조)에 따르면, 상업적 TDM은 권리자가 "기계 판독 가능한 수단"으로 권리를 유보하지 않은 경우에만 허용됩니다. 따라서 기계 판독 가능한 옵트아웃(robots.txt, ai.txt, 메타데이터)은 단순히 예의를 차리는 것이 아니라 법적으로 의미가 있습니다.
- 명확한 역할 분담. 소규모 팀이라도 데이터 소싱(data sourcing), 권리/개인정보 검토, 데이터셋 관리(stewardship), 감사(audit)를 누가 담당하는지 지정하면 도움이 됩니다.
- 보유 제한(Retention limits). 워크플로우에 필요한 데이터만, 필요한 기간 동안만 유지하십시오.
데이터셋 구축 시 구조화된 데이터가 원시 HTML보다 나은 이유
구조화된 API는 지원되는 플랫폼에 대해 문서화된 JSON을 반환하며, 이는 스크래핑된 페이지보다 데이터셋을 관리(govern)하기 훨씬 쉽게 만듭니다:
- 출처가 내장되어 있음. 각 응답은 소스와 요청 컨텍스트(request context)를 포함하므로, 모든 행이 어디에서 왔는지에 대한 컬럼을 유지할 수 있습니다.
- 일관된 스키마(Schema). 필드가 문서화되어 있고 안정적이므로, 데이터 정제(cleaning) 및 중복 제거(dedupe) 작업이 사이트별 추측이 아닌 결정론적(deterministic) 방식으로 이루어집니다.
- 파서 부식(Parser rot) 없음. 조용히 깨지면서 데이터셋을 오염시키는 셀렉터(selectors)를 유지 관리할 필요가 없습니다.
- 공공 데이터 중심. 플랫폼 엔드포인트는 공개 기록을 반환하므로, 위에서 언급한 법적 경계선에서 더 방어 가능한 위치를 유지할 수 있습니다.
# 데이터셋 행으로 저장할 준비가 된, 소스 컨텍스트를 포함한 구조화된 레코드 수집
curl -s "https://api.crawlora.net/api/v1/google-search/search?keyword=web%20scraping%20api&country=us" \
-H "x-api-key: $CRAWLORA_API_KEY"
import requests
rows = []
...
데이터셋의 감사 가능성 (auditable)을 유지할 수 있도록 데이터와 함께 source 및 collected_at 필드를 저장하세요.
5단계의 준수 워크플로우 (compliant workflow)
- 방어 가능한 소스로 범위 제한 — 무차별적인 크롤링이 아니라, 이용 약관 (Terms of Service)을 검토한 특정 플랫폼으로 범위를 제한하고, 기계 판독 가능한 거부 (machine-readable opt-out) 설정이 되어 있는 것은 제외하세요.
- 구조화된 레코드 수집 — 문서화된 엔드포인트(또는 호스팅된 MCP 서버)를 호출하고 JSON 형식을 유지하세요. 파이프라인에 우회(circumvention) 로직을 구축하지 마세요.
- 출처(provenance) 첨부 — 모든 행(row)에 출처(source), URL/식별자, 타임스탬프, 라이선스 근거 및 요청 파라미터를 포함하세요.
- 정제 및 중복 제거 (Clean & dedupe) — 정규화(normalize)를 수행하고, 중복을 제거하며, 필요하지 않은 개인정보 (PII)는 삭제하거나 마스킹(mask) 처리하세요.
- 문서화 — 학습을 시작하기 전에 짧은 데이터 시트(datasheet)(출처, 날짜, 필드, 라이선스 참고 사항, 알려진 공백 등)를 작성하세요.
책임 있는 사용
Crawlora는 공공 데이터 인프라를 제공할 뿐, 어떠한 콘텐츠라도 어떠한 AI 목적으로 사용할 수 있는 권한을 부여하는 것은 아닙니다. 학습 및 재배포는 일반적인 수집을 넘어 라이선스 및 저작권 문제를 야기할 수 있습니다. 공공의 사실적 데이터를 유지하고, 출처의 약관 및 기계 판독 가능한 거부 설정을 준수하며, 불필요한 개인정보를 피하고, 구체적인 사용 사례에 대해서는 법률 전문가와 상담하십시오.
출처 (Sources)
Sources
- X Corp. v. Bright Data — ToS, copyright, and scraping public data (ArentFox Schiff / National Law Review)
- Training AI on personal data scraped from the web (IAPP)
- Towards Best Practices for Open Datasets for LLM Training
- Datasheets for Datasets (Gebru et al.) — dataset documentation
- hiQ Labs v. LinkedIn — accessing public data and the CFAA
다음 단계 (Next steps)
다음 단계 (Next steps)
AI vs traditional web scraping에서 확인하고, 최고의 AI 웹 스크래핑 도구들을 비교하고, Playground에서 AI 웹 스크래핑 API를 사용해 보세요.
자주 묻는 질문 (Frequently asked questions)
스크랩한 웹 데이터를 AI 모델 학습에 사용할 수 있나요?
때로는 가능하지만, 아직 명확하게 정립되지 않았고 활발히 법적 분쟁이 벌어지는 영역입니다. 미국 저작권청(US Copyright Office)의 2025년 보고서에 따르면, 저작권이 있는 작품들로 학습 데이터셋을 구성하는 것은 복제권(reproduction right)과 관련되므로, 공정 이용(fair use)은 주장할 수 있는 방어 논리일 뿐 보장된 것이 아닙니다. 공개적이고 사실적인 데이터를 유지하고, 각 출처의 약관 및 모든 데이터셋 라이선스를 확인하며, 근거 없이 저작권이 있는 미디어와 개인 데이터는 피하고 법률 자문을 받으세요. Crawlora는 데이터 인프라이지 법률 자문 서비스가 아닙니다.
이용약관(Terms of Service)이나 robots.txt 파일만으로 AI 스크래핑을 불법으로 만드나요?
그 자체만으로는 그렇지 않습니다. X Corp. v. Bright Data (2024) 사건에서 법원은 플랫폼이 사용자 콘텐츠에 대한 저작권을 무효화하기 위해 이용약관(ToS)을 사용할 수 없다고 판결했으며, 법원들은 robots.txt가 기술적 접근 통제(technical access control)라기보다는 요청(request)임을 확인했습니다. 하지만 옵트아웃(opt-outs)을 무시하는 것은 여전히 약관 위반이 될 수 있으며, 속도 제한(rate limits)이나 봇 방지 시스템 우회는 별도의 DMCA 위험 요소입니다.
AI를 위해 공개 데이터를 스크래핑하는 것이 공정 이용으로 간주되나요?
이것이 핵심적인 미해결 질문입니다. 공개적이고 사실적인 데이터를 읽어들이는 것은 가장 방어하기 쉬운 방법이며, 저작권이 있는 창작물로 학습시키는 경우에 공정 이용 여부가 다투어지고 법원 판결도 엇갈리고 있습니다. 아직 포괄적인 답변은 없으므로, 특정 콘텐츠를 분석하고 법률 자문을 받으셔야 합니다.
AI 데이터셋을 준수하게 유지하려면 어떻게 해야 하나요?
방어할 수 있는 출처로 범위를 제한하고, 기계 판독 가능한 거부 의사 표시(robots.txt, ai.txt, TDM 예약)를 존중하며, 안티 봇(anti-bot) 제어 장치를 우회하지 마세요. 모든 레코드에 출처(source), URL, 타임스탬프(timestamp), 라이선스(license), 거부 상태(opt-out status)와 같은 출처 정보(provenance)를 유지하고, 중복을 제거(dedupe)하며, 개인정보(PII)를 삭제하거나 피해야 합니다. 또한 학습 전 데이터시트(datasheet)를 통해 데이터셋을 문서화하세요.
AI 학습 데이터를 위해 구조화된 API를 사용하는 이유는 무엇인가요?
문서화된 JSON은 데이터셋을 더 쉽게 관리(govern)할 수 있게 해줍니다. 출처(provenance)와 출처 맥락(source context)이 내장되어 있고, 스키마(schema)가 안정적이어서 데이터 정제(cleaning)와 중복 제거(dedupe)가 결정론적(deterministic)으로 이루어지며, 공공 기록(public records)에 집중할 수 있고, 행(row)을 조용히 깨뜨리거나 손상시킬 파서(parser)가 없습니다.
RAG를 위한 스크래핑은 학습을 위한 스크래핑과 다른가요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기