업데이트: 수백만 개의 ChatGPT 사용자 대화가 검색되었으나, OpenAI가 정보를 숨기고 있다는 의혹 제기
요약
OpenAI의 저작권 침해 소송 과정에서 2,000만 개의 ChatGPT 대화 로그가 비식별화된 상태로 원고 측에 제공되었습니다. 그러나 원고들은 OpenAI가 임시 채팅 기록을 누락하거나 과도한 편집을 적용하는 등 정보를 은폐하고 있다고 주장하며 법적 제재를 요청했습니다.
핵심 포인트
- 법원 명령에 따라 2,000만 개의 ChatGPT 대화 로그가 원고 측에 제공됨
- OpenAI는 비식별화 도구를 사용하여 개인정보를 제거했다고 주장
- 원고 측은 임시 채팅 기록 누락 및 과도한 데이터 편집 의혹 제기
- 데이터 은폐 의혹에 따른 OpenAI 대상 법적 제재 요청 진행 중
원문 게시일: 2026년 1월 6일; 업데이트: 2026년 7월 9일
뉴욕시 연방법원에서 진행 중인 OpenAI, Inc. 저작권 침해 소송 (Copyright Infringement Litigation) 사건의 한 측면에서 논란이 되고 있는 점은, 일반 사용자들의 ChatGPT 대화 내용이 검색 및 기타 소송 관련 용도로 사용하기 위해 원고 측에 공개되도록 명령되었다는 것입니다. 이 개념은 2025년 중반, 소송 당사자 간의 문서 및 정보 교환인 "증거 개시 (discovery)"를 감독하는 Wang 치안판사가 피고인 OpenAI 측에 모든 ChatGPT 대화 기록 또는 "출력 로그 (output logs)"를 보존하도록 명령했을 때, 예를 들어 Reddit의 ChatGPT 사용자들 사이에서 상당한 파장을 일으켰습니다.
그 후 2025년 11월, Wang 치안판사는 원고들이 키워드 검색을 수행할 수 있도록 OpenAI가 이 사용자 대화 로그 중 2,000만 개(당초 요청된 1억 2,000만 개에서 감소)를 "비식별화 (de-identified)"된 형식으로 제공할 것을 명령했습니다. 법원의 인용에 따르면, 사용자 대화는 "'OpenAI의 맞춤형 비식별화 도구 (custom de-identification tool)'를 사용하여 [대화 로그]에서 개인 식별 정보 및 기타 개인 정보를 모두 제거함으로써" "비식별화"됩니다. OpenAI는 Wang 치안판사의 명령에 맞서 싸웠으나, 당시 사건의 재판장이었던 Stein 판사가 이를 지지하였고, 2,000만 개의 대화 로그는 키워드 검색이 가능하도록 제공되었습니다. (Stein 판사는 2026년 초에 퇴임하였으나, 당시 진행 중이던 소송 분쟁을 해결하기 위해 한동안 직무를 유지했습니다.)
Wang 치안판사가 OpenAI에 명령한 것은 대화를 공개적으로 배포하는 것과는 거리가 멀며, 원고들은 검색 및 검색 결과를 소송 관련 목적으로만 사용하도록 제한됩니다. 또한, 대화 로그는 "비식별화"되고 있지만, 우리는 OpenAI의 맞춤형 "비식별화" 도구가 정확히 어떻게 작동하는지, 또는 사용자들의 채팅 기록을 얼마나 세탁(laundered)했는지 정확히 알지 못합니다. 그럼에도 불구하고, 이번 자료 제출은 자신의 챗봇 대화가 영구적으로 사적이고 신성불가침할 것이라고 생각했던 이들에게 또 다른 압박이 되었습니다.
(물론, 그동안 법원은 공개된 리테일 챗봇(retail chatbot)과의 어떠한 대화도 사생활에 대한 기대치를 갖지 않는다고 판결했습니다. 이에 대한 저의 설명 포스트는 여기와 여기에 있습니다.) 업데이트: 2,000만 개의 대화 로그가 2025년 12월 15일에 키워드 검색을 위해 원고 측에 제공되었습니다. 하지만 문제는 거기서 끝나지 않았습니다. 제출된 챗봇 대화 내용을 검토하고 OpenAI 관계자들과 대화한 후, 원고들은 매우 불만족스러워했습니다. 원고들은 OpenAI가 자료 제출 전부터 ChatGPT의 "임시 채팅 (Temporary Chat)" 기능을 통해 생성된 일부 대화를 포함하여 수많은 ChatGPT 대화를 보존하지 않았다고 주장합니다. 제출된 2,000만 개의 대화 로그 내에서도, 원고들은 OpenAI가 검색 증강 생성 (RAG, Retrieval Augmented Generation)을 사용하는 대화 샘플을 과소 표기했으며, 로그에 190억 건의 편집(redactions)을 적용하여 로그당 평균 1,000건의 편집이 이루어졌음을 시사한다고 주장합니다. 2026년 7월 9일, 일부 원고들은 대화 로그 및 기타 항목과 관련된 의혹이 있는 부당한 행위에 대해 OpenAI에 제재(sanction)를 가해달라고 법원에 요청했습니다. 그들은 법원에 다음과 같은 여러 구제책을 요청했습니다: 1. OpenAI가 제출된 2,000만 개의 대화 로그를 OpenAI의 방어 목적으로 사용하는 것을 금지할 것 2. 원고들이 제출된 대화 로그를 통해 증명하려 했던 바와 같이, 원고들의 저작물들이 ChatGPT 대화를 통해 사용자들에게 "실질적이고 체계적으로" 추출되어 제공되었다는 사실을 사전에 확정적 사실로 인정할 것 3. 재판 과정에서 배심원단에게 OpenAI가 수십억 개의 대화를 삭제했다는 사실을 공개적으로 알릴 것 4. OpenAI의 부당한 행위로 인해 발생했으며, 해당 행위에 맞서 싸우고 제재(penalties) 요청을 소송하는 과정에서 지출된 원고 측의 변호사 비용 및 비용을 OpenAI가 지불하도록 할 것. 원고들의 제재 요청 내용은 여기에서 확인할 수 있습니다.
원고들의 제재 요청에 대해 OpenAI는 이제 답변서를 제출할 것이며, 몇 달 후 Wang 치안판사(Magistrate Judge)에게 결정이 내려지기 위해 제출될 것입니다. 하지만 이러한 종류의 "증거 개시 (discovery)" 요청은 항상 즉각적으로 처리되는 것은 아니며, 대신 때로는, 심지어 자주, 재판 시점까지 "미뤄지기도 (kicked down the road)" 하는데, 이 사건의 재판은 아직 상당히 멀리 남아 있습니다. 새로운 소식이 있으면 계속 알려드리겠습니다! 요약 (TLDR): 뉴욕 연방 저작권 소송이라는 거대한 사건에서, OpenAI는 7개월 전 검색을 위해 2000만 개의 "비식별화된 (de-identified)" ChatGPT 사용자 대화 로그를 원고 측에 공개했습니다. 그러나 원고들은 해당 로그에 대규모의 편집 (redactions)이 있었으며 OpenAI가 기타 방해 행위를 했다고 주장하며, 증거 개시 위반 (discovery misconduct)에 대해 OpenAI를 제재(처벌)하도록 법원에 신청했습니다. ~~~~~~~~~ 모든 AI 법정 사례 및 판결 목록은 Wombat Collection을 참조하십시오. /u/Apprehensive_Sky1950가 r/OpenAI에 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기