
AI 기업들의 희귀 도서 대량 매입 및 파쇄 관행
요약
AI 기업들이 학습 데이터 확보를 위해 희귀 도서를 대량 매입한 뒤 스캔 후 파쇄하는 관행이 드러났습니다. 법원은 이를 공정 이용으로 판결했으며, Anthropic 등 기업들은 데이터 확보를 위해 공격적인 행보를 보이고 있습니다.
핵심 포인트
- AI 기업들이 희귀 도서를 스캔 후 파쇄하여 학습 데이터로 활용
- ISBNdb는 익명성과 대량 주문을 지원하며 이를 '디지털 보존'이라 명명
- 법원은 원본 파쇄를 근거로 해당 행위가 공정 이용에 해당한다고 판결
- 희귀 도서의 영구적 손실 및 데이터 독점 문제 제기
🦔AI 기업들이 희귀 도서를 대량으로 매입하여, 책등을 잘라내는 고속 스캐너로 스캔한 뒤 원본을 파쇄하고 있습니다. ISBNdb라는 서비스는 최대 100만 권의 도서 주문을 용이하게 하며 구매자의 익명성을 보장합니다. 2022년 이전의 도서들은 AI 생성 텍스트가 포함되어 있지 않기 때문에 프리미엄 가치를 지닙니다. 연방 판사는 원본을 제거함으로써 한 번에 단 한 권의 복사본만 존재하게 된다는 점을 근거로, 이러한 관행이 공정 이용 (Fair Use)에 해당한다고 판결했습니다. Anthropic은 "세상의 모든 책"을 확보하기 위해 전 Google Books 파트너십 책임자를 고용했습니다.
나의 견해
이 소식은 저를 충격에 빠뜨렸습니다. 한 서적 판매자는 404 Media에 생존해 있는 복사본이 거의 없는 희귀 도서들이 이 파이프라인에 투입되고 있다고 말했습니다. 전쟁과 화재, 수 세기 동안의 취급을 견뎌낸 책들이 AI가 더 나은 마케팅 이메일을 쓰는 법을 배우기 위해 파쇄되고 있습니다.
ISBNdb의 웹사이트에는 문자 그대로 "'AI 기업이 200만 권의 책을 파괴한다'는 헤드라인은 동정심을 유발하지 않는다"라고 적혀 있으며, 그들은 여전히 이를 조용히 실행하는 것을 중심으로 전체 비즈니스를 구축했습니다. 그들은 비밀 유지 계약 (NDA)을 하나의 기능(feature)으로 제공합니다. 또한 고객들에게 이를 "디지털 보존 (digital preservation)"이라고 부르도록 교육합니다.
저는 AI 기업들이 인터넷을 스크래핑(scraping)하고, 라이브러리를 토렌트(torrenting)하며, 음악을 훔치는 사례들을 다뤄왔습니다. 하지만 이것은 되돌릴 수 없다는 점에서 더 심각합니다. 웹사이트는 다시 업로드할 수 있습니다. 베스트셀러는 다시 인쇄할 수 있습니다. 하지만 누군가가 학습 데이터(training data)를 위해 18세기 식물학 텍스트의 마지막 남은 세 권을 파쇄해 버린다면, 그것을 대체할 방법은 없습니다. 그리고 판사는 이것이 합법이라고 말했습니다. 따라서 이 현상은 가속화될 것입니다.
"우리는 희귀 도서를 파쇄하고 아무도 알지 못하도록 NDA를 제공한다"는 것이 2026년의 정당한 비즈니스 모델이 되었습니다. 참으로 기막힌 시대입니다.
Hedgie🤗
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기