AI 기업들이 희귀 도서를 파쇄하고 있다 — 그리고 이것은 학습 데이터에 관한 모든 것을 변화시킨다
요약
AI 기업들이 학습 데이터의 법적 정당성을 확보하기 위해 희귀 도서를 매입한 뒤 스캔 후 파쇄하는 충격적인 관행이 드러났습니다. 이는 실물 복사본을 없애 시장 피해가 없다는 '공정 이용' 논리를 강화하려는 전략적 움직임입니다.
핵심 포인트
- AI 기업들이 학습 데이터의 법적 방어력을 높이기 위해 실물 도서를 파쇄함
- 디지털 스캔본만 남겨 소유권 분쟁 및 시장 피해 주장을 차단하려는 의도
- 절판 도서 및 희귀 도서를 매입하는 지하 시장과 중간 상인들이 급증함
- 저작권 소송에 대응하기 위한 AI 기업들의 극단적인 데이터 확보 전략
원문은 The AI Prism에 처음 게시되었습니다.
AI 분야에서 가장 조용한 범죄
이번 주 Hacker News에서 화제가 되고 있는 이야기(추천 794개, 댓글 514개, 계속 상승 중)는 AI 기업들이 학습 데이터셋 (training datasets)을 구축하는 방식에 대해 매우 불안한 사실을 드러내고 있습니다. 이는 정확히 저작권에 관한 문제도 아니고, 직접적인 개인정보 보호에 관한 문제도 아닙니다. 그것은 더 오래되고 본능적인 문제, 즉 희귀 도서의 물리적 파괴에 관한 것입니다.
보고에 따르면, AI 기업들이나 이들을 대신해 일하는 중간 업체들은 희귀 도서 및 절판된 도서들을 매입하여, 학습 파이프라인 (training pipelines)에 공급하기 위해 페이지별로 스캔한 뒤, 실물 복사본을 파쇄하고 있습니다.
기부하는 것도 아닙니다. 돌려주는 것도 아닙니다. 파쇄하는 것입니다.
그 논리는 냉혹하고 계산적입니다. 만약 디지털 복사본이 단 하나만 존재한다면, 해당 학습 데이터가 합법적으로 획득되었는지에 대해 의문의 여지가 없기 때문입니다. 모호함을 만들어낼 두 번째 복사본도 없고, 소유권을 다툴 원본도 남지 않습니다. 물리적인 책은 부채 (liability)가 됩니다. 디지털 스캔본은 이 맥락에서 해당 책이 존재했다는 유일한 증거가 됩니다.
2026년의 '책장 화재'에 오신 것을 환영합니다.
우리가 여기까지 오게 된 과정: 잘못된 인센티브의 사슬
이런 일은 진공 상태에서 발생한 것이 아닙니다. 왜 희귀 도서들이 파괴되고 있는지 이해하려면, 이곳으로 이끈 왜곡된 인센티브 (perverse incentives)의 사슬을 따라가야 합니다.
1단계: 출판사들은 불법 복제본으로 구축된 Books3와 같은 섀도우 라이브러리 (shadow library) 데이터를 학습에 사용했다는 이유로 AI 기업들을 고소했습니다. 소송은 공격적이었고 세간의 주목을 받았습니다. Authors Guild, The New York Times, 그리고 자신의 저작물이 학습 세트에서 발견된 개인 작가들이 그 대상이었습니다.
2단계: AI 기업들은 메시지를 이해했습니다. 그들은 섀도 라이브러리 (shadow libraries)에 의존하는 것을 중단하고, 더 방어 가능한 채널을 통해 콘텐츠를 확보하기 시작했습니다. 출판사들과의 계약 (OpenAI와 Axel Springer, Dotdash, Financial Times 간의 파트너십 등), 라이선스 데이터 계약 (Licensed data agreements), 그리고 — 어떤 출판사도 라이선스를 줄 수 없는 틈새 시장의 절판 도서나 고아 저작물 (orphaned works)을 위해 — 그들은 실물 도서를 구매하기 시작했습니다.
3단계: 학습 목적으로 실물 도서를 스캔한 후 원본을 파쇄하는 것은 방어 가능한 공정 이용 (fair use) 주장을 생성한다는 법적 이론이 등장했습니다. 논리는 다음과 같습니다. 만약 실물 복사본이 더 이상 존재하지 않는다면, 경쟁 제품이 없으므로 시장 피해가 발생하지 않는다는 것입니다. 한 연방 판사가 적어도 하나의 판결에서 이 논거를 인용했다고 전해집니다.
그 결과는 무엇일까요? 희귀 도서를 위한 지하 시장의 호황입니다. 수집가를 위한 것이 아니라, 문서 파쇄기를 위한 시장입니다.
규모는 생각보다 더 큽
우리는 고작 수십 권의 초판본을 이야기하는 것이 아닙니다. 우리는 수백만 권의 책을 이야기하고 있습니다. (현재 이 문제를 다루는 유일한 주류 기술 매체인) Tom's Hardware의 조사에 따르면, AI 기업들은 도서 확보 업무를 도서관 매각물, 유산 정리 판매, 대학 폐기 도서, 중고 서점을 뒤지는 중간 상인들에게 외주를 주었습니다.
이 중간 상인들은 자신이 어느 AI 기업을 위해 일하는지조차 밝힐 수 없을 정도로 엄격한 비밀 유지 계약 (nondisclosure agreements) 하에 운영됩니다. 책들은 대량으로 구매되어 공개되지 않은 스캔 시설로 운송되고, 산업적 규모로 디지털화된 후 — 파쇄됩니다.
이 경제학이 작동하는 이유는 **학습 데이터의 희소성 (training data scarcity)이 병목 현상 (bottleneck)**이기 때문입니다. 프런티어 AI 연구소들은 이미 공개된 웹의 대부분을 스크래핑 (scraping)했습니다. Reddit, Wikipedia, GitHub, Common Crawl, Stack Overflow 등 말입니다. 쉽게 얻을 수 있는 데이터 (low-hanging fruit)는 이미 사라졌습니다. 더 깊이 추론하고, 더 자연스럽게 글을 쓰며, 더 잘 일반화 (generalize)하는 차세대 모델을 학습시키기 위해서는 더 높은 품질의 데이터가 필요합니다. 그리고 출판된 도서보다 더 높은 품질의 텍스트는 없습니다.
AI 데이터 시장의 추정치에 따르면, 고품질 텍스트 데이터셋은 현재 100만 토큰당 5~15달러에 거래되고 있으며, 이는 불과 2년 전 몇 센트 수준이었던 것과 대조적입니다. 습득 비용이 200달러인 희귀 도서 한 권이 500,000개의 학습 데이터 토큰을 생성할 수 있다면, 이는 라이선스 데이터 계약과 맞먹는 경제성을 갖게 됩니다. 여기에 파쇄를 통한 법적 방어력이라는 추가적인 이점까지 더해집니다.
이것을 가능하게 하는 법적 허점
여기서 공정 이용 (Fair Use) 논거는 영리하면서도 매우 우려스러운 특정 해석에 기반하고 있습니다. 즉, 원본을 디지털화한 후 파괴한다면, 잠재적인 시장 피해를 제거한 것이 된다는 논리입니다.
그 논거는 다음과 같습니다:
공정 이용 (Fair Use) 분석은 네 가지 요소를 고려합니다:
• 이용의 목적과 성격 (The purpose and character of the use) — 변형적 (Transformative)인가? AI 학습은 점점 더 변형적이라고 간주되고 있습니다.
• 저작물의 성격 (The nature of the copyrighted work) — 출판된 저작물은 미출판 저작물보다 보호를 덜 받습니다. 이 책들은 출판된 것입니다.
• 사용된 양 (The amount used) — 책 전체가 스캔되는데, 이는 공정 이용에 반하는 요소입니다.
• 잠재적 시장에 미치는 영향 (The effect on the potential market) — 이것이 핵심입니다. 만약 물리적인 책이 파괴된다면, 그 책을 위한 시장은 존재하지 않게 됩니다. 경쟁 관계에 있는 디지털 버전도 없고, 판매 손실도 없습니다.
네 번째 요소를 제거함으로써, AI 기업들은 책 전체가 복제되었고 아무도 원본을 다시 읽을 수 없게 되었음에도 불구하고, 균형이 공정 이용 쪽으로 기울어지는 시나리오를 만들어냅니다.
이 스레드에 대한 HN (Hacker News) 토론은 전문을 읽어볼 가치가 있습니다. 514개의 댓글이 달리고 있으며, 의견은 "이것은 인류 지식의 비극이다"부터 "어차피 아무도 읽지 않던 오래된 책들이 더 나은 용도로 쓰이는 것이다"까지 다양합니다. 업계 종사자라고 주장하는 한 댓글 작성자는 다음과 같이 적었습니다: "출판사들은 나중에 거액의 콘텐츠 계약을 협상하기를 기대하며 섀도 라이브러리 (Shadow Library) 데이터를 학습한 AI 기업들을 고소했습니다. 그 결과 그들이 마주한 세상은 책들이 그냥 파괴되는 세상입니다. 축하합니다, 출판사 여러분. 스스로 자초한 일입니다."
실제로 무엇을 잃고 있는가?
지식 보존에 관심을 가진 사람이라면, 이 이야기는 개인적인 문제로 다가올 것입니다.
표적이 되는 책들은 베스트셀러가 아닙니다. 심지어 더 이상 인쇄되지도 않는 책들입니다. 그것들은 바로 고아 저작물 (orphaned works) — 즉, 틈새 학술 단행본, 절판된 기술 매뉴얼, 지역사, 18세기의 식물학 텍스트, 그리고 수십 년 전 폐업한 소규모 출판사의 시집 같은 것들입니다.
이 책들은 바로 상업적 가치가 없기 때문에 도서관들이 보존에 어려움을 겪는 바로 그 책들입니다. 대학 도서관의 특수 소장 자료실에 단 한 권만 존재할 수도 있는 책들이며, 혹은 AI 중간 상인들이 먼저 가로채 버렸기 때문에 점점 더 많은 책이 어떤 도서관에도 존재하지 않게 되고 있습니다.
AI 기업이 희귀 도서를 구매하여 파쇄할 때, 그 지식이 사라지는 것은 아닙니다. 하지만 더 이상 대중이 접근할 수 없게 됩니다. 그 지식은 독점적인 학습 데이터 세트 (training set) 안에 갇혀, 오직 모델의 API를 통해서만 접근할 수 있게 됩니다. 당신은 그 내용을 찾아볼 수도, 인용할 수도, 재발견할 수도 없습니다. 당신은 오직 모델에게 그 내용을 요약해 달라고 요청할 수 있을 뿐입니다 — 물론 모델이 그 특정 정보를 유지하고 있으며, 그것을 통계적 패턴으로 압축해 버리지 않았다는 가정하에 말입니다.
이는 도서관이 하는 일과 정반대입니다. 도서관은 보존합니다. 공유합니다. 세대를 거쳐 지식을 이용 가능하게 만듭니다. AI 파쇄 파이프라인은 간신히 살아남아 있던 지식을 가져다가 민간 모델을 위한 비재생 자원으로 전환해 버립니다.
Internet Archive와의 연관성
Internet Archive에 대해 이야기하지 않고는 이 이야기를 완성할 수 없습니다.
실물 도서를 스캔하여 디지털로 대여해 주던 Archive의 Open Library 프로젝트는 출판사들로부터 소송을 당했고, 이 사건은 제2순회 항소법원(Second Circuit)까지 올라갔습니다. 그 판결은 디지털 보존에 있어 재앙이었습니다. 법원은 Internet Archive의 통제된 디지털 대여가 경쟁적인 디지털 시장을 형성한다는 이유로, 그것이 공정 이용 (fair use)에 해당하지 않는다고 판결했습니다.
아이러니하게도 상황은 경악스럽습니다. 대중에게 책을 제공하기 위해 도서를 스캔했던 **비영리 도서관 (nonprofit library)**은 공정 이용 (fair use) 방어권을 상실했습니다. 반면, 영리 목적의 AI 기업들은 비밀 유지 계약 (NDA) 뒤에서 책을 스캔하고 파쇄하고 있으며, 법 체계는 Archive가 거부당했던 바로 그 공정 이용 프레임워크를 통해 이들에게 면죄부를 주고 있는 것으로 보입니다.
한 HN(Hacker News) 댓글 작성자는 다음과 같이 직설적으로 말했습니다: “그것이 바로 archive.org가 실물 사본을 보유한 책을 대여했다는 이유로 소송을 당해서는 안 되었던 이유입니다. 이것이 그 결과입니다. 출판사들은 자신들이 무엇을 바라는지 더 신중해야 할 것입니다.”
아무도 말하지 않는 데이터 희소성 위기
도서 파쇄에 대한 도덕적 공황 아래에는 AI 개발에 관한 더 근본적인 이야기가 숨겨져 있습니다. 바로 우리는 데이터가 고갈되고 있다는 점입니다.
Epoch AI 연구 그룹은 수년 동안 이를 추적해 왔습니다. 그들의 최신 추정치에 따르면, 고품질 텍스트 데이터는 2026~2028년 사이에 고갈될 것입니다. 프런티어 연구소 (frontier labs)들은 이미 인터넷의 대부분을 소비했습니다. 남은 것은 저품질 데이터(소셜 미디어의 소음), 페이월 (paywalls) 뒤에 갇힌 데이터(학술 논문, 뉴스 아카이브), 또는 물리적 데이터(디지털화되지 않은 도서)뿐입니다.
도서 파쇄 파이프라인은 이러한 희소성에 대한 직접적인 대응입니다. AI 기업들이 책을 파괴하는 것은 그들이 악해서가 아닙니다. 고품질 텍스트의 다른 모든 소스를 소진했으며, 더 나은 모델을 구축해야 한다는 압박이 끊임없이 몰아치고 있기 때문입니다.
“어떤 대가를 치르더라도”라는 질문 없이 산업계에 “더 나은 것을 만들어라”라고 말할 때 발생하는 현상이 바로 이것입니다.
스캐너 속의 유령: 파이프라인이 실제로 작동하는 방식
이 이야기를 이해하려면 먼지 쌓인 도서 판매 현장에서 신경망 가중치 (neural network weight) 파일에 이르기까지의 사슬을 따라가야 합니다. 이는 극도의 불투명성을 위해 설계된 공급망입니다.
1단계: 습득 (Acquisition). 중간 상인들 — 종종 무해한 이름을 가진 유령 LLC (shell LLCs) 형태로 운영됨 — 은 유산 정리 판매 (estate sales), 대학 도서관의 폐기 도서, 중고 서점 폐업 현장에 나타납니다. 이들은 대량으로 입찰하며, 종종 시장가보다 높은 가격을 지불합니다. 평소 폐기 도서를 권당 15달러에 판매하던 대학 도서관이 이 구매자들로부터 1020달러의 제안을 받을 수도 있습니다. 판매자들은 거의 질문을 하지 않습니다.
2단계: 분류 (Triage). 도서들은 AI 학습을 위한 인지된 가치에 따라 분류됩니다. 기술 매뉴얼 (technical manuals), 학술 단행본 (academic monographs), 전문 참고 문헌 (specialized reference works), 그리고 절판된 문학 소설 (out-of-print literary fiction)이 가장 높은 순위를 차지합니다. 대중적인 베스트셀러와 이미 디지털 형태로 널리 이용 가능한 도서들은 우선순위가 낮습니다. 선택된 도서들은 스캔 시설로 보내집니다. 나머지 도서들 — 그리고 많은 가치 있는 도서들이 오분류될 가능성이 높음 — 은 곧장 파쇄기로 향합니다.
3단계: 산업용 스캔 (Industrial scanning). 이것은 여러분이 도서관에서 기억하는 평판 스캐너 (flatbed scanners)가 아닙니다. 산업용 도서 스캐너는 시간당 1,0003,000페이지를 처리할 수 있습니다. 이들은 페이지를 넘기는 로봇과 함께 오버헤드 카메라를 사용하여, 300600 DPI로 양쪽 페이지를 동시에 캡처합니다. 단일 시설이 5만 권 규모의 도서관 전체를 한 달 이내에 디지털화할 수 있습니다.
4단계: OCR 및 처리 (OCR and processing). 스캔된 이미지는 OCR (광학 문자 인식) 파이프라인을 거쳐 정제되고, 형식이 지정된 후 학습 데이터셋 (training datasets)에 입력됩니다. 저자, 출판사, ISBN, 출판일과 같은 모든 메타데이터 (metadata)는 제거됩니다. 목표는 서지적 맥락 (bibliographic context)이 아니라 깨끗한 텍스트입니다.
5단계: 파괴 (Destruction). 산업용 파쇄기는 물리적인 도서를 펄프 (pulp) 상태로 만듭니다. 종이 폐기물은 일반적으로 재활용되어, 암울할 정도로 효율적인 순환 구조를 완성합니다. 디지털 복사본을 제외하고는 아무런 흔적도 남지 않습니다. 그 복사본은 여러분이 결코 이름을 알 수 없는 기업이 소유하며, 여러분이 검증할 수 없는 목적으로 사용되고, 여러분이 오직 API를 통해서만 접근할 수 있는 모델을 학습시키는 데 사용됩니다.
이 모든 운영 과정은 보이지 않도록 설계되었습니다. 로고도 없습니다. 공공 기록도 없습니다. 도서에서 학습 데이터셋에 이르기까지 종이로 된 흔적(paper trail)도 남지 않습니다.
오픈 소스 AI의 관점: 왜 이것이 소규모 플레이어들에게 가장 큰 타격을 주는가
오픈 소스 대규모 언어 모델 (LLM)을 구축하는 사람의 관점에서 이를 생각해 보십시오. 그들은 희귀 도서를 구입하여 파쇄할 여력이 없습니다. 심지어 100만 토큰당 5~15달러에 달하는 고품질 학습 데이터 (training data) 라이선스를 구매할 여력조차 없습니다. 그들은 Common Crawl, Wikipedia, Project Gutenberg, Internet Archive와 같이 공개적으로 사용 가능한 것에 의존합니다.
하지만 Internet Archive는 법적 공세에 직면해 있습니다. Common Crawl은 웹사이트들이 크롤러 (crawler)를 차단함에 따라 필터링되고 축소되고 있습니다. Project Gutenberg에는 퍼블릭 도메인 (public domain)에 속한 도서만 있어, 이는 20세기와 21세기의 대부분의 지식에 접근할 수 없음을 의미합니다.
가장 많은 자본을 가진 기업들이 최고의 데이터에 접근하며, 원본을 파괴함으로써 다른 누구도 이를 얻지 못하도록 확실히 하고 있습니다. 이것은 더 나은 AI를 만드는 것에 관한 문제가 아닙니다. 학습 데이터 공급망 주위에 해자 (moat)를 구축하는 것에 관한 문제입니다.
오픈 소스 AI 옹호자들은 수년 동안 이에 대해 경고해 왔습니다. 그들은 학습 데이터의 비용이 결국 컴퓨팅 자원 (compute), 인재, 알고리즘이 아닌, 진정한 진입 장벽이 될 것이라고 주장했습니다. 우리는 파쇄되는 책 한 권 한 권을 통해 그 예측이 실시간으로 실현되는 것을 목격하고 있습니다.
데이터가 말해주는 것
이러한 관행의 운영 방식은 불투명할지라도, 그 경제성은 놀라울 정도로 투명합니다.
희귀 도서 또는 절판 도서의 비용: $5-200 (대규모 구매 시 대량 구매 할인이 강력하게 적용됨)
도서당 스캐닝 비용: $1-3 (산업 규모의 스캐닝은 저렴함)
도서당 토큰 수: 길이에 따라 50,000-500,000개
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기