의료 데이터가 상품이 된 이유: 왜 건강 기록이 가장 가치 있는 훈련 데이터인가
요약
본 기사는 의료 AI 개발의 핵심 동력이 모델 자체가 아니라 비식별화된 전자의무기록(EHR)이라는 데이터를 상품으로 거래하는 시장 구조에 있음을 지적합니다. 장기간, 라벨링되어 있고 다중 양식인 임상 데이터가 희소성 때문에 높은 가치를 가지며, 이것이 의료 AI 산업의 근본적인 진실입니다.
핵심 포인트
- 의료 AI는 모델 논쟁보다 EHR 데이터 라이선싱 계약서에 주목해야 한다.
- 장기적(longitudinal)이고 라벨링된 임상 기록은 희소성 때문에 매우 가치하다.
- 임상 데이터는 이미징, 검사 결과 등 다중 양식(multimodal)의 특성을 가진다.
2021년, 아마 들어본 적 없는 회사가 약 5천만 명에 달하는 미국인의 비식별 의료 기록을 조용히 인수했습니다. 그 가격은 약 10억 달러로 보고되었습니다. 이 기록에는 이름과 사회보장번호가 제거된 진단명, 처방전, 검사 결과, 방문 이력 등이 포함되어 있었습니다. 판매자는 이러한 데이터를 치료의 부산물로 수집했던 병원 및 의료 시스템이었습니다. 구매자들은 아무도 동의하지 않은 제품을 만들고 있었습니다.
이것은 스캔들이 아닙니다. 이것은 비즈니스 모델입니다. 그리고 이는 의료 AI 분야에서 거의 아무도 이야기하지 않는 가장 중요한 일입니다.
우리는 AI가 의사를 대체할지, 아니면 모델이 투약량을 환각(hallucinate)할지에 대해 계속 논쟁합니다. 그동안 실제 의료 AI 산업의 근본적인 진실(ground truth)은 EHR(전자의무기록) 하나하나씩 추출되고, 포장되어, 판매되고 있습니다. 만약 의료 AI가 어디로 가고 있는지 이해하고 싶다면, 모델 카드 읽는 것을 멈추세요. 데이터 라이선싱 계약서를 읽기 시작하세요.
다음 내용은 이 시장이 실제로 어떻게 작동하는지, 왜 당신의 건강 기록이 유전체보다 더 가치 있는지, 그리고 대부분의 AI 개발자들을 불편하게 만들 반대 주장 하나를 파헤칩니다. 당신은 다음에 누군가 '우리는 비식별 임상 데이터로 훈련한다'라고 말할 때 적용할 수 있는 사고 모델을 얻게 될 것입니다.
건강 데이터가 다른 어떤 것보다 가치 있는 이유
경제학부터 시작하겠습니다. 왜냐하면 윤리(ethics)는 인센티브를 이해한 후에만 의미가 있기 때문입니다.
당신의 소셜 미디어 게시물은 몇 센트의 일부에 불과합니다. 당신의 검색 기록은 아마도 연간 몇 달러 정도일 것입니다. 원본 형태의 유전체는 이미 상품화되어, 시퀀싱 회사들은 데이터를 얻기 위해 무료로 검사를 제공할 정도입니다. 하지만 당신의 종단적(longitudinal) 의료 기록, 즉 수년간의 진단명, 처방전, 검사 추이, 영상 기록, 그리고 결과는 정말 희귀합니다.
그 이유는 다음과 같습니다:
장기적입니다 (longitudinal). 건강 상태의 스냅샷은 거의 가치가 없습니다. 결과(outcomes)가 포함된 10년간의 기록이야말로 금광이기 때문입니다. 왜냐하면 모델이 단순히 진단 자체가 무엇이었는지뿐만 아니라, 그 진단 이후에 무슨 일이 일어나는지 학습할 수 있게 해주기 때문입니다.
라벨링되어 있습니다 (labeled). 웹에서 무작위로 긁어온(scraped) 텍스트와 달리, 임상 기록은 구조화된 코드, 표준 어휘집, 의사 주석을 가지고 옵니다. 이것이 비지도 학습(unsupervised) 텍스트 더미와 지도 학습(supervised) 훈련 세트의 차이입니다.
희소합니다 (scarce). 전체 공개 웹은 홍수와 같습니다 (firehose). 깨끗하고, 장기적이며, 결과에 연결된 임상 데이터는 물방울과 같습니다. 희소성이 가격을 결정합니다.
다중 양식(multimodal)입니다. 이미징, 검사 결과(labs), 메모, 유전체학(genomics), 활력 징후(vitals). 대부분의 훈련 데이터는 단일 양식(single-modality)입니다. 임상 기록은 본질적으로 다중 양식이며, 이것이 바로 최첨단 의료 모델(frontier medical models)이 필요로 하는 것입니다.
그 결과, 비식별화된 환자 기록이 수억에서 낮은 수십억 달러에 거래되는 시장이 형성되었고, 구매자는 단순히 병원뿐만 아니라 보험사, 제약 회사, 그리고 점점 더 임상 데이터를 활용하여 의료 모델을 미세 조정(fine-tune)해야 하는 AI 연구소들입니다.
동의의 환상 (The Consent Illusion)
이것은 실용주의자라 할지라도 당신을 불편하게 만들 부분입니다.
이 데이터 대부분은 미국에서는 HIPAA, 유럽에서는 GDPR에 의해 규제되는
당신은 개인정보 처리 방침(Notice of Privacy Practices)에 서명합니다. 분량이 10~15페이지에 달합니다. 그 안에는 당신의 데이터가 '치료, 지불 및 운영' 목적으로 사용될 수 있다는 내용이 적혀 있습니다.
그 안에 어딘가에 파묻힌 듯한 '연구(research)'와 '비즈니스 협력사(business associates)'에 대한 문구가 있습니다.
당신은 그것을 읽지 않습니다. 아무도 읽지 않습니다. 그게 핵심입니다.
그러면 당신의 데이터는 비식별화(de-identified)되어 데이터 브로커에게 팔리고, 이 데이터 브로커가 모델 개발자에게 판매하며, 모델 개발자는 이를 이용해 시스템을 훈련시키고, 이 시스템이 결국 당신의 병원에 다시 판매될 수 있습니다.
당신은 요청받지 않았습니다. 알려진 적도 없습니다. 그리고 보상받은 적도 없습니다. 그 거래는 당신이 유창하지 않은 언어로, 당신이 통제할 수 없는 시간표 위에서 일어났습니다.
성역의 소(The Sacred Cow): '비식별화 데이터는 윤리적으로 안전하다'
저는 AI 커뮤니티가 수년 동안 방목해 온 성역의 소 한 마리를 잡고 싶습니다. 바로 비식별화 데이터가 개인정보가 아닌 데이터와 윤리적으로 동등하다는 믿음입니다.
이 믿음은 매우 중요합니다. 이는 전체 산업의 법적, 도덕적 기반이기 때문입니다. 그리고 그것은 대부분 틀렸습니다.
그 이유는 다음과 같습니다. 비식별화는 직접적인 식별자(direct identifiers)를 제거할 뿐입니다. 구별 가능성(distinguishability)을 제거하지 않습니다. 희귀한 진단명, 특정 연령, 우편번호(ZIP code), 시술 날짜가 포함된 비식별화 기록은 인구 집단 내에서 한 사람에게만 고유할 때가 많습니다. 그 고유성이 버그가 아니라, 데이터의 가치를 높이는 특징입니다. 임상 데이터가 모델에 유용하게 만드는 바로 그 속성들이 데이터를 재식별화(re-identifiable)할 수 있게 만듭니다.
기술 산업은 10년 동안 자신들에게 '이름이 사라지면 사람이 사라진다'고 이야기해 왔습니다. 그것은 사실이 아닙니다. 사람은 분포(distribution)이지, 필드(field)가 아닙니다. 이름이라는 필드를 제거해도 분포는 남아 있습니다. 모델은 당신의 이름을 전혀 알지 못하면서도 당신의 패턴을 학습할 수 있으며, 이것만으로도 당신에 대해 추론(inferences)하고, 판매하거나, 차별하는 데 충분합니다.
윤리적인 결론은 불편합니다: 비식별화는 도덕적 방패가 아니라 법적 방패입니다. 산업계가 이에 의존하는 것은 그것이 옳기 때문이 아니라, 방어하기 쉽기(defensible) 때문입니다. 그리고 '방어 가능성'은 '동의(consent)'와 같지 않습니다.
실제 가치가 흐르는 곳 (스포일러: 당신에게는 아닙니다)
잠시 돈의 흐름을 따라가 봅시다.
환자는 치료 과정의 부산물로 데이터를 생산합니다. 보상도, 투명성도, 동의(opt-in)도 받지 못합니다.
병원은 이 데이터를 수집하여 데이터 브로커에게 일괄 금액 또는 기록당 비용으로 판매합니다. 이 수익은 종종 병원 예산에 비해 작기 때문에 판매가 조용히 이루어집니다.
데이터 브로커는 데이터를 집계하고 정제한 다음, 여러 구매자에게 라이선스를 부여합니다. 마진이 가장 많이 발생하는 단계가 바로 여기입니다.
제약 회사나 AI 연구소는 이 데이터를 사용하여 모델을 훈련하거나, 약물을 검증하거나, 진단을 개발합니다. 여기서 가치가 복리처럼 쌓입니다.
병원은 결국 자체 환자 데이터로 훈련된 모델을 구매할 수 있지만, 공급업체에 종속되어 협상할 수 없는 가격으로 사야 합니다.
환자가 근원지입니다. 환자가 대상입니다. 환자가 이 체인에서 어떤 혜택도 가장 마지막에 보는 사람입니다.
다른 산업에는 이를 지칭하는 용어가 있습니다: 추출(extraction). 기술 커뮤니티는 소셜 미디어 플랫폼이 사용자로부터 데이터를 '추출'하는 것에 대해 수년간 비판해 왔습니다. 이제 그 시각을 의학에도 적용할 때입니다.
좋은 사례란 무엇인가 (그리고 왜 희귀한가)
저는 여러분에게 비판만 남기고 싶지 않습니다. 작동하는 모델들이 있으며, 이는 연구할 가치가 있습니다.
합성 데이터(Synthetic data). GAN과 확산 모델(diffusion models)은 실제 개인을 노출하지 않으면서 통계적 속성을 보존하는 합성 환자 기록을 생성할 수 있습니다. 종양학 및 심장학 분야의 초기 결과는 유망하지만, 충실도 격차(fidelity gap)가 실재하며 종종 과소평가됩니다.
연합 학습(Federated learning). 데이터를 이동시키지 않고 여러 병원에서 훈련하는 방식입니다. 구글이 만성 질환 네트워크와 유방 촬영술에 대해 수행한 작업은 대표적인 예시입니다. 이는 더 느리고, 더 비싸며, 배포하기가 더 어렵기 때문에 정확히 희귀합니다.
환자 동의 프레임워크(Patient consent frameworks). UK Biobank나 All of Us 같은 일부 코호트(cohort)는 명시적이고 철회 가능한 동의를 설계에 포함합니다. 하지만 트레이드오프(tradeoff)가 있습니다. 바로 규모입니다. 이러한 코호트들은 집계된 데이터 브로커 시장(aggregated data broker market)보다 수 배에서 수십 배 작습니다.
데이터 신탁 및 협동조합(Data trusts and cooperatives). 환자들이 거버넌스 권리(governance rights)를 보유하고 수익을 공유하는 모델입니다. 초기 파일럿 사례는 존재합니다. 하지만 상업 시장의 규모에 도달한 곳은 없습니다.
이 패턴을 주목하세요. 윤리적인 접근 방식들은 더 느리고, 작고, 그리고 수익성이 낮습니다. 이것은 우연이 아닙니다. 현재 상업 시장이 존재하는 전체 이유입니다.
실제로 취할 수 있는 조치(What To Actually Do About It)
만약 의료 AI 분야에서 일하는 개발자라면, 생각보다 더 많은 영향력(leverage)을 가지고 있습니다. 세 가지 구체적인 행동 방안입니다.
-
단순히 비식별화(de-identification)가 아닌 출처(provenance)를 요청하세요. 임상 데이터를 획득하거나 라이선스를 받을 때, 그것이 어디서 왔는지, 동의는 어떻게 얻었는지, 그리고 환자들이 어떤 구제 수단(recourse)을 가지고 있는지 물어보세요. 공급업체가 답할 수 없다면, 당신은 모래 위에 건물을 짓고 있는 것입니다. 그 답변을 모델 카드(model card)에 문서화하세요.
-
재식별 위험(re-identification risk)을 위한 도구를 마련하세요. 학습시키기 전에 재식별 감사(re-identification audit)를 수행하세요. k-익명성 지표(k-anonymity metrics), 멤버십 추론 테스트(membership inference tests), 그리고 보조 데이터셋 공격(auxiliary dataset attacks)을 사용하세요. 만약 당신의 '비식별화'된 데이터셋이 이러한 테스트에 실패한다면, 그것은 비식별화된 것이 아닙니다. 누군가 시도할 때까지는 단지 식별되지 않은 것일 뿐입니다.
-
가능한 경우 연합 학습(federated) 및 합성 파이프라인(synthetic pipelines)을 선호하세요. 이것들은 더 어렵고 느립니다. 하지만 규제가 강화될 경우 유일하게 방어 가능한 장기적인 경로이기도 합니다. 강요당하기 전에 지금부터 역량을 키우세요.
만약 당신이 환자라면, 여기 더 어려운 진실이 있습니다. 현재 시스템에서 당신은 거의 영향력이 없습니다. 할 수 있는 최선은 다음 방문 시 개인정보 보호 관행 통지(Notice of Privacy Practices)를 읽고, 데이터가 제3자와 공유되는지 물어보고, 허용되는 곳에서는 거부하는 것입니다. 이것이 시장을 막지는 못할 겁니다. 하지만 이 경험은 시장이 어떻게 작동하는지 가르쳐 줄 것이며, 그 지식은 복리처럼 쌓입니다.
사고 모델(The Mental Model)
제가 여러분에게 유지하길 바라는 렌즈가 있습니다.
의료 데이터는 자원이 아닙니다. 관계입니다. 그것은 한 사람의 신체, 두려움, 진단명, 그리고 최악의 날들이 구조화된 필드에 압축되어 가장 높은 가격을 제시하는 이에게 팔리는 기록물입니다. 업계는 이것을 상품으로 취급하는데, 이는 경제학이 작동하는 유일한 방식이기 때문입니다. 하지만 그 경제학은 자연법칙이 아니라 선택입니다.
임상 데이터로 모델을 구축할 때마다, 당신은 다음 사람을 위해 더 나은 무언가를 만들기 위해 누군가의 최악의 날을 빌리는 것입니다. 이것은 정당한 일입니다. 동시에 빚이기도 합니다. 문제는 우리가 의료 데이터를 모델 학습에 사용할 것인지 여부가 아닙니다. 이미 사용하고 있습니다. 문제는 그 데이터를 생산한 사람들이 거래의 입력값(inputs)이 아니라 당사자(parties)로 취급될 수 있을지 여부입니다.
시장은 답을 가지고 있습니다. 그리고 그것은 좋은 답이 아닙니다.
이에 대해 어떻게 생각하시나요? 임상 데이터와 작업해 본 경험이 있다면, 동의(consent)와 출처(provenance)를 어떻게 처리하셨나요? 아직 해보지 않으셨다면, 당신의 기록이 팔렸는지 알고 싶으신가요? 댓글로 남겨주세요. 이 분야의 빌더들이 이것에 대해 어떤 생각을 하고 있는지 정말 궁금합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기