AI 기업들이 광고업체에 데이터를 유출함 [pdf]
요약
AI 기업들이 사용자의 대화 내용, 프롬프트 등 민감한 데이터를 제3자(광고업체 포함)에게 공개하거나 판매하는 보안 문제를 지적합니다. 이는 단순 유출이 아닌 의도적인 데이터 활용이며, 사용자 추적 및 광고 목적으로 이용될 위험성이 높습니다.
핵심 포인트
- AI 기업의 대화 내용 등 민감 정보가 제3자에게 노출되거나 판매됨.
- 단순한 '유출'이 아니라 수익성을 위한 '의도적 행위'로 간주해야 함.
- 사용자의 프롬프트 작성 과정까지 추적되어 광고 목적으로 활용될 위험성이 있음.
- 개방형 모델을 통해 사용자 데이터 통제권을 확보하는 것이 중요함.
옛 심슨 가족의 Milhouse 에피소드가 떠오름. Lisa가 교무실에 가 보니 교직원들이 아이들을 비웃고 있고, 관리인 Willie는 “나는 Milhouse야. 친구가 없어서 Willie에게 비밀을 다 털어놓지!”라며 흉내를 냄. 나중에 창피한 일을 당한 Milhouse는 울면서 “Willie한테 말해야겠어!”라며 달려감.
이제 우리 모두가 Milhouse가 된 셈임.
불평등이 지난 약 50년 동안 사회적 신뢰를 침식하면서 세상을 이해하던 기존 틀 상당수가 더는 유효하지 않게 됨. 주변 모든 것이 적대적이면 살아가기 어려움.
“여러 제공업체가 제목, 프롬프트, 스크린샷 등 대화에서 파생된 민감한 정보를 제삼자에게 공개하며, 사용자를 특정할 수 있는 영구 식별자도 함께 전달하는 경우가 많음. 일부 업체는 접근 통제 없이 대화 고정 링크를 공개해 추적기가 대화 전체를 읽을 수 있게 함.” 전혀 바람직하지 않음.
많은 AI 채팅 서비스가 URL에 UUID가 있으면 개인정보가 보호된다고 여기는 듯한 게 가장 못마땅함. Perplexity도 과거 검색 URL에 접속하면 대화 전체가 노출됨.
스크린샷에 실수로 남는 민감한 정보가 상당히 많음. 이는 매우 큰 보안 문제임.
데이터를 “유출”하는 게 아니라 판매하는 것임. 유출이라면 실수가 있어야 하지만, 이건 의도적인 행위임.
계속 이 점을 강조해도 홍보 담당자들은 “작은 개인정보 문제가 생겨 죄송하며 다음 개발 주기에 바로 고치겠다”는 식으로 포장하고, 여론전에서 이기고 있음. 동의한 이용약관에 들어 있는 사업 계획이지, “유출”이 아님.
AI 기업들이 데이터를 그토록 쌓아두려 한다는 점에서 의외임. 일부 광고 기업은 직접적인 경쟁사이기도 함. 광고 기능을 급하게 구현했거나, 수익성을 요구하는 투자자들의 압력이 회사 자체의 이익과 충돌하는 것 같음.
AI 채팅 광고의 효과를 극대화하려면 어느 정도 데이터가 외부로 나가야 할 수도 있음. 그래도 경쟁사에 맡기기보다는 직접 맞춤형 광고를 내보내고 싶어 할 듯함. AI 기업이 광고를 게재하는 수준을 넘어 광고 기업 자체가 되는 것도 무서운 일임.
훨씬 큰 AI 기업들을 지원하는 AI 회사에서 온보딩을 받고 있는데, 바이브 코딩으로 만든 플랫폼과 문서가 엄청나게 많음. 교육 과정이 엉망이라 플랫폼이 아예 로드되지 않을 때도 있음. 한 번도 시험하지 않은 것들이 배포되고 사용을 강요받는데, 사람이 손대 본 적도 없고 손대고 싶지도 않을 수준임.
초록만 읽었지만, 핵심은 실수로 유출됐는지 의도적으로 제공했는지임. 내 추측은 우발적 유출이며, 그렇다면 전혀 놀랍지 않음. 데이터를 판매했어도 놀랍지는 않겠지만 그건 별개임.
OpenAI는 서비스를 안전하게 운영할 경험이나 자원이 부족하다는 점을 여러 차례 드러냈고, 운영 안정성도 인상적이지 않음. 수익성과 성장을 좇아 모든 걸 서두른다는 추측에 동의함.
조금 다른 얘기지만, 최근 브라우저에서 ChatGPT를 쓰면 전송 버튼을 누르기도 전에 작성 중인 프롬프트를 conversation/prepare로 주기적으로 전송하는 것을 발견함.
캐시를 미리 준비하는 용도일 수 있지만, 사용자의 입력 속도와 오류 수정 습관, 아이디어가 프롬프트로 구체화되는 과정까지 추적하는 데 쓰일 수도 있음. 이런 데이터 역시 광고주에게 팔릴 수 있다고 봄.
이달 초 나비에–스토크스 연구 공로 분쟁과 같은 교훈임. Buckmaster와 Alpoge는 비공개 Codex 세션에 미발표 초안을 넣었고, OpenAI는 아무도 이를 보지 않았다고 하면서도 비식별화한 제품 데이터가 모델 개선에 쓰였을 가능성은 인정함. 거기서는 학습 데이터이고 여기서는 광고 추적기일 뿐, 비공개로 남아야 할 프롬프트와 결과가 그렇지 못하다는 점은 같음.
그래서 완벽하지 않더라도 개방형 모델이 이겨야 함. 앱을 거치지 않고 모델을 직접 실행할 수 있기 때문임.
OpenAI 경영진 상당수가 Meta 출신이고 그곳에서 호되게 배웠을 테니, 정말 의도적으로 이러는 거라면 의외임. 사용자 정보를 광고 네트워크에 넘기면 결국 새어나가 고객이 알게 되고 크게 분노하게 됨.
더 중요한 건 데이터를 외부에 팔기보다 내부에 보유하고 직접 광고 타기팅에 쓰는 편이 더 좋은 사업 모델이라는 점임. 독점적인 타기팅 데이터가 광고 판매에 막대한 경쟁 우위를 줌.
지금 Meta가 하는 방식이 그 모델임. 광고주에게 광고를 볼 사람의 명단을 주는 대신, 광고주가 원하는 특성을 받으면 Meta가 대상자를 결정함.
고객들은 분노해도 결국 아무 일 없었다는 듯 중독적인 디지털 서비스를 계속 쓰고 잊어버릴 것임.
데이터를 자체 보유하는 편이 더 나을 수는 있지만, LLM 기업들이 이미 포화된 광고 시장에 진입할 시간이 있을지는 의문임. 돈은 계속 빠져나가고 수익성 확보 경로도 없으며, 특히 OpenAI는 내년 데이터센터 지출에 터무니없는 약속을 해놓은 상태임. 지금 당장 현금이 필요함.
배우지 못했거나 잘못된 교훈을 얻은 듯함. 데이터를 파는 것보다 쌓아두는 편이 보통 더 수익성이 높으니 고의 유출이라고 보지는 않음. 하지만 업계에서 오래 일했다면 빠르게 움직이고 망가뜨리는 태도가 엄청난 데이터 유출을 일으켰다는 걸 알 것임.
OpenAI 같은 기업이 사용자를 전혀 신경 쓰지 않는다는 사실을 부정하는 사람이 많은 듯함. 서명한 계약도 개의치 않으며, 그들에게 사용자는 돈벌이 수단일 뿐임.
OpenAI든 다른 대기업이든 자신을 진심으로 신경 쓴다고 누가 믿는 건가? 그런 믿음이 널리 퍼져 있다는 전제 자체가 사실과 다름.
광고 기술 업계는 클릭 기록에서 의도를 추론하려고 20년을 보냈음. 이제 채팅 앱은 AI가 한 줄로 요약한 사용자 의도에 라벨을 붙이고 쿠키와 연결해 넘겨줌. AI 광고 사업 모델의 핵심이 정말 채팅 안에 광고를 넣는 것일까, 아니면 채팅 자체를 광고 타기팅 신호로 쓰는 것일까?
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기