OpenAI 소송 관련 기사: NYT 사건에서 드러난 Microsoft의 '노동 탈취' 메모
요약
NYT가 OpenAI와 Microsoft를 상대로 제기한 저작권 침해 소송의 최신 판결문이 공개되며, AI 스크래핑에 대한 논란이 재점화되었습니다. 내부 메모에는 AI 학습 과정에서의 데이터 사용 방식과 라이선스 문제에 대한 비판적 발언들이 포함되어 있습니다. 이는 기업들의 기술 개발 방향성과 저작권 보호 사이의 근본적인 충돌을 보여줍니다.
핵심 포인트
- AI 스크래핑이 '노동 탈취'로 지적되며 논란 가중
- NYT는 OpenAI와 Microsoft를 상대로 저작권 침해 소송 진행 중
- 내부 메모에는 유료 콘텐츠 라이선스 확보 필요성 강조
- 소송은 기술 개발과 창작물 보호 간의 법적 경계를 다룸
2023년 1월, 한 Microsoft 디렉터가 AI 스크래핑을 "인류 역사상 가장 큰 노동 탈취"라고 언급한 내부 메모를 작성했습니다. 지난 9월 17일, 연방 법원은 New York Times(NYT)가 OpenAI와 Microsoft를 상대로 제기한 소송의 요약 판결문 제출 서류를 공개했으며, 그 문구가 이제는 공론화되었습니다. 이 내용은 Satya Nadella, Greg Brockman 그리고 ChatGPT 자체 제품 책임자의 발언과 나란히 놓여 있습니다. 만약 귀하의 팀이 라이선스를 받지 않은 데이터로 학습을 진행하거나, 이에 대해 솔직한 메모를 작성한다면, 이 OpenAI 소송은 반드시 읽어봐야 할 내용입니다.
요약 (TL;DR)
- Microsoft의 Applied Science 디렉터인 Brent Hecht는 2023년 1월에 AI 스크래핑을 "전례 없는 규모의 놀라운 탈취"라고 언급했습니다. 1년 후 그의 슬라이드에는 Copilot의 답변 엔진이 nytimes.com으로의 클릭률을 최대 93%까지 떨어뜨렸다고 나와 있습니다.
- Times의 요약서에 따르면, Nadella는 "유료 장벽(paywalled)인 것은 모두 라이선스를 받아야 한다"고 증언했고, Brockman은 "nytimes 유료 장벽을 우회하는 해킹 방법"이라는 질문에 "아, 멋지네."라고 답했습니다.
- 해당 요약서는 OpenAI의 중간 학습 데이터 세트에서 원고 측 기사 91,692건 이상과 하나의 Common Crawl 기반 세트에서 2백만 건 이상의 nytimes.com 문서를 포함하고 있습니다.
- 모든 인용문은 Times의 요약서에서 가져온 것입니다. 증거 자료는 아직 봉인되어 있어, 이들은 맥락 없이 원고 측이 선별한 내용입니다. OpenAI와 Microsoft는 논평을 제공하지 않았습니다.
- 또한 이번 에피소드에서는 법률(Law)용 OpenAI의 Astra, 즉
.git폴더를 업로드하는 코딩 에이전트와 OpenAI 내부 저장소에 대한 6,500달러 규모의 보상금 지급 내용도 다루었습니다.
NYT 대 OpenAI 소송은 무엇인가요?
New York Times는 2023년 12월에 OpenAI와 Microsoft를 고소했으며, 이 사건은 올해 12월로 세 번째 해를 맞이합니다. The Daily News와 Center for Investigative Reporting가 공동 원고입니다. 주장은 저작권 침해입니다. 즉, 해당 회사들이 기사들의 저널리즘을 복사하여 모델 학습에 사용했고, 그 결과 현재 경쟁 관계를 형성하고 있다는 것입니다.
새로 제출된 문건들은 요약 판결 신청(summary-judgment motions)입니다. 이 단계에서 각 측은 재판 없이 일부 질문에 대해 판사에게 판단을 요청하는데, 이는 사실관계 자체가 실질적으로 다투어지는 문제가 아니라고 주장하기 때문입니다. 이러한 주장을 뒷받침하기 위해 원고들은 상대방의 이메일, 슬라이드 자료, 증언 기록 등을 인용합니다. 이것이 인용문들이 매우 날카롭고 신중해야 하는 이유이며, 변론서는 곧 '주장의 기술'이기 때문입니다. [TechCrunch]에서 작성한 기사(https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/)는 이 모든 내용의 근거가 되며, 아래 내용은 Times 측 변론서에서 인용된 것이지만 증거 자료(exhibits)들은 여전히 봉인되어 있어 '원래 맥락 없이 제시되었다'고 지적합니다.
Jason Kint, Digital Content Next CEO는 다음 링크를 통해 해당 문건을 공개하며 검열된 부분을 분홍색으로 표시했습니다:
Microsoft의 '노동 탈취' 메모
Brent Hecht는 Microsoft의 Applied Science 디렉터입니다. 변론서에 따르면, 그가 2023년 1월 작성한 메모에서 AI 스크래핑을
Hecht는 이를 '둠 루프(doom loop)'라 부르며, 이는 '우리 모델과 전체 웹의 성능에 동시에 악영향을 미칠 것'이라고 했습니다. 만약 답변 엔진이 출판사들의 트래픽을 고갈시킨다면, 출판사들은 콘텐츠 생산을 중단하고 모델은 배울 새로운 것이 없게 됩니다. 그의 요약은 이렇습니다: '최종 제품이 필수 공급업체의 경제적 기반을 위협하는 것은 매우 이례적인 일입니다.' 변론서에 포함된 또 다른 Microsoft 문서는 생성형 AI가 기초 모델(foundation model) 학습 데이터의 원천인 사람들의 고용에 '상당한 혼란'을 초래할 수 있는 '실제 위험'이 있다고 명시합니다.
변론서에 따르면 Nadella, Brockman, Turley가 말한 내용
Satya Nadella는 올해 증언에서 다음과 같이 말했습니다: '유료화된(paywalled) 모든 것은 사용하려는 누구에게나 라이선스가 부여되어야 합니다… 접지(grounding) 또는 학습을 위해.' 만약 그가 OpenAI가 유료화된 콘텐츠를 스크래핑했다는 것을 알았다면, 그는 'OpenAI에 모델 재학습을 요구할 수 있는 [Microsoft의 권리]를 발동했을 것'이라고 말했습니다. 같은 서류에는 'OpenAI가 전체 GPT-3 학습 데이터셋을 Microsoft에 전달했으며', Microsoft가 Bing 인덱스의 자료를 포함하여 'Project Taxi'와 'Project Mango'라는 프로젝트를 통해 데이터를 반대 방향으로 보냈다'고 나와 있습니다. 이 변론서의 핵심은 다음과 같습니다: Nadella는 자신이 알지 못했다고 말하는 내용물을 담고 있는 데이터셋을 Microsoft가 보유하고 있었다는 것입니다.
Nick Turley, ChatGPT 책임자는 내부적으로 출판사들이 '실존적 위협(existential threat)'에 직면해 있으며, ChatGPT는 '상당히 대체재적(substitutive)'이며 '더 좋아질수록 더욱 대체재적이 될 것'이라고 작성했습니다. 대체(Substitution)는 The Times의 핵심 주장입니다: 즉, 제품이 종이에 의존하는 것이 아니라 그것을 대체한다는 것입니다.
Greg Brockman, OpenAI 사장은 모델들이 '뉴스에 탁월하다'고 말했습니다. 연구원 Nick Ryder가 그에게
그리고 한 가지 엔지니어링 세부 사항이 있습니다. 연구원들은 모델이 사용자에게 '저작권 고지'를 출력하는 것을 원치 않았기 때문에 훈련 데이터에서 저작권 고지(copyright notices)를 제거했습니다. 이 고지를 제거하면 출력물에서도 사라집니다. 이는 마치 자전거의 일련번호를 빼는 것처럼 보이는 사안입니다.
훈련 데이터에 뉴욕 타임스 콘텐츠가 얼마나 포함되어 있었나?
TechCrunch가 보도한 소장(brief)의 수치입니다:
| 데이터셋 | 소장이 담고 있다고 주장하는 내용 |
|---|---|
| OpenAI 중간 훈련 데이터셋 | NYT, Daily News 및 CIR의 저작물을 91,692개 이상 복사본 포함 |
| ... | |
| 공개 아카이브인 Common Crawl은 크롤링된 웹 페이지를 모아놓은 것입니다. 하나의 도메인에서 나온 두 백만 개의 페이지가 단일 파생 세트에 담겨 있다는 것은 누군가 필터링하지 않는 한 대형 출판사의 사이트 중 얼마나 많은 부분이 '웹'에 남게 되는지를 보여줍니다. |
AI 훈련이 공정 이용(fair use)인가? 법원이 내린 판결은?
헤드라인에서 건너뛴 부분입니다. TechCrunch에 따르면, 지금까지 판사들은 공정 이용 방어 논리(fair-use defense)에 대체로 '호의적'이었으며, 이달 초에는 트럼프 행정부가 OpenAI의 무허가 훈련을 공정 이용으로 방어하는 소장을 제출했습니다.
가장 명확한 판결은 Bartz 대 Anthropic 건입니다. Alsup 판사는 2025년 6월에 합법적으로 취득된 책을 기반으로 한 훈련은 공정 이용이라고 판단했지만, Anthropic이 다운로드했던 약 7백만 개의 불법 복제본은 아니라고 했습니다. Anthropic은 2025년 9월에 (https://en.wikipedia.org/wiki/Anthropic#Legal_issues) 책당 약 $3,000인 15억 달러로 합의했으며, 최종 승인은 2026년 7월에 이루어졌습니다.
법적 질문은 여전히 열려 있으며, 현재 기록으로는 OpenAI가 자체 학습에 대해서는 유리할 수 있습니다. 하지만 제출된 서류들이 다루는 내용은 다른 것입니다. 시스템을 구축한 사람들이 9월 17일 기준으로 이것이 괜찮다고 생각했는지에 대한 답은 그들 자신의 말 속에 담겨 있습니다. Ed Newton-Rex는 이를 100개가 넘는 AI 저작권 소송 중 '가장 큰 인정'이라고 불렀습니다 [링크]. Hacker News에서는 모두가 그것이 도난이라고 동의한 것은 아니었습니다: American87은 TechCrunch가
Astra for Law. OpenAI는 같은 목요일에 Astra for Law를 출시했습니다 (HN): GPT-6 Astra 모델은 제가 일주일 전에 [REVERT]로 표시했던 모델에, Harvey 및 Legora 파트너와 Free Law Project의 CourtListener가 제공하는 2억 3천만 개 이상의 URL을 포함하는 법률 검색 인덱스가 추가되었습니다. Vals AI의 법률 리서치 벤치(Legal Research Bench)에서 이 모델은 일반 웹 검색을 사용한 Astra 대비 38.7%에서 54.0%로 향상된 성과를 보였습니다. OpenAI는 이를
사진을 통해 OpenAI의 저장소에 침투하다. Hacktron (HN)은 HEIF 이미지 라이브러리인 libheif의 힙 오버플로우(heap overflow)를 사용하여 community.openai.com에서 코드 실행을 확보했고, 이후 단일 로그인(single sign-on) 설정 오류와 GitHub 통합을 통해 OpenAI 내부 저장소에 접근하는 데 72시간도 걸리지 않았습니다. 이 익스플로잇은 Claude가 작성했습니다: Opus 4.8로는 주소 무작위화(address randomisation)를 통과할 수 없었지만, Opus 5는 출시 후 3시간 만에 작동하는 익스플로잇을 만들어냈습니다. 여러 회사를 아우르는 이 전체 캠페인은 토큰 비용이 3,000달러 미만이었습니다. OpenAI는 약 14시간 만에 이를 수정하고 6,500달러를 지불했습니다.
판결: 검토 필요
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기