MD Anderson, 건물 밖에서 테스트조차 해보지 않은 AI에 최소 6,200만 달러를 지출하다
요약
MD Anderson 암 센터가 IBM Watson 기반의 임상 의사 결정 지원 도구 구축에 6,200만 달러를 투입했으나, 외부 파일럿 테스트 없이 내부 데이터로만 평가되어 실효성을 검증하지 못한 사례를 분석합니다. 이는 거버넌스 문제와 데이터 검증의 인식론적 문제를 동시에 보여줍니다.
핵심 포인트
- 6,200만 달러 규모의 프로젝트가 외부 검증(out-of-sample test) 없이 종료됨
- 내부 데이터로만 학습 및 평가된 시스템은 측정 대상과 도구의 출처가 동일해 왜곡된 결과를 초래함
- 이 프로젝트는 승인 절차를 무시한 거버넌스 실패와 실질적 성능 검증 실패라는 두 가지 문제를 가짐
- 시스템이 기존 전자 건강 기록(Epic)과 데이터 호환이 되지 않는 기술적 결함도 존재함
당신이 측정한 개선 사항은 공분산 (covariance)이지, 인과관계 (cause)가 아닙니다
2013년, MD Anderson 암 센터는 IBM과 함께 Watson 기술을 사용하여 임상 의사 결정 지원 도구 (clinical decision support tool)를 구축하기 시작했습니다. 이는 Oncology Expert Advisor라고 불렸습니다. 이 도구는 치료법을 권장하고, 환자를 임상 시험에 매칭하며, 사례 평가를 돕도록 설계되었습니다. 약 4년에 걸쳐 이 프로젝트에는 최소 6,200만 달러가 투입되었습니다.
2016년 9월까지도 이 시스템은 임상 현장에서 사용되지 않았습니다. IBM은 그해 9월 1일부로 파일럿 및 데모 시스템에 대한 지원을 종료했습니다. 이후 텍사스 대학교 시스템 (University of Texas System)의 감사가 진행되었고, 이듬해 2월에 언론 보도가 이어졌습니다.
모두가 인용하는 숫자는 6,200만 달러입니다. 하지만 실제로 중요한 사실은 감사 보고서의 바로 아래 줄에 있습니다. 즉, 이 시스템은 MD Anderson 외부의 그 어디에서도 파일럿 테스트를 거친 적이 없었다는 점입니다.
이는 소프트웨어가 좋았는지 여부에 대한 진술이 아닙니다. 무엇을 알 수 있었을지에 대한 진술입니다. 한 기관의 관행으로 학습되고, 오직 그 기관 내부에서만 평가된 임상 의사 결정 지원 시스템은, 그 시스템을 가르친 사람들을 대상으로 측정됩니다. 일치하는 결과가 나오는 것은 당연한 결과입니다. 권장 사항이 의학적으로 탁월하든 의학적으로 틀리든 상관없이 예상되는 결과였을 것입니다. 왜냐하면 측정 대상과 측정 도구가 동일한 출처를 공유하기 때문입니다.
실패할 '표본 외 테스트 (out-of-sample test)' 자체가 없었습니다. 그것이 바로 6,200만 달러로 산 결과물입니다.
두 가지 조사 결과를 구분하십시오
감사 보고서는 오독하기 쉬우며, 이를 잘못 읽는 것이 이 이야기를 가장 빠르게 틀리게 이해하는 방법입니다.
감사관들이 발견한 것은 조달 (procurement) 문제였습니다. 계약, 승인, 준수 사항 등이 이에 해당합니다. 지출의 거의 대부분이 이사회의 승인 없이 진행되었습니다. 또한 그들은 이 도구가 병원이 전환한 Epic 전자 건강 기록 (electronic health record) 시스템과 데이터를 교환할 수 없었다는 점을 지적했습니다. 이로 인해 종양학 전문의들은 Epic이 대체한 시스템의 프로토콜 및 임상 시험 데이터를 참고해야 하는 상황에 놓였습니다.
감사관들이 명시적으로 수행하지 않은 것은 모델을 평가하는 것이었습니다. 검토 보고서 자체의 범위 정의(scope statement)는 이를 계약 및 준수(compliance)로 한정하며, 프로젝트 관리나 시스템 개발은 포함하지 않는다고 명시하고 있습니다. 이 48페이지 분량의 문서는 Oncology Expert Advisor가 좋은 조언을 제공했는지 여부에 대한 판결문이 아닙니다. 아무도 그 판결을 내리지 않았는데, 그 판결을 내리려면 결국 실행되지 않았던 외부 파일럿(external pilot) 테스트가 필요했기 때문입니다.
따라서 여기에는 두 가지 실패가 있으며, 이들은 서로 다른 종류의 실패입니다. 하나는 필요한 승인 없이 자금이 집행되었다는 점입니다. 다른 하나는 4년간의 작업 결과가 건물 밖으로 나갈 수 있는 어떠한 증거도 생성하지 못했다는 점입니다. 첫 번째는 거버넌스(governance) 문제이며, 두 번째는 인식론적(epistemics) 문제로, 이는 어디에서나 반복되는 문제입니다.
실제로 외부 검증을 수행했을 때의 모습
관련은 있지만 별개의 제품인 Watson for Oncology는 Memorial Sloan Kettering과 함께 학습되었으며 다른 기관들에 배포되었습니다. 따라서 우리는 마침내 테스트가 실행되었을 때 어떤 일이 일어나는지 확인할 수 있습니다.
일치율(Concordance rates), 즉 시스템의 권장 사항이 현지 종양 위원회(tumor board)와 얼마나 자주 일치하는지는 사이트와 암 종류에 따라 엄청나게 차이가 납니다. 인도의 유방암 환자 638명을 대상으로 한 이중 맹검 연구(double-blind study)에서는 권장(recommended) 또는 고려 대상(for-consideration) 치료에 대해 93%의 일치율을 보고했습니다. 2017년 ASCO에서 발표된 한국 환자 525명을 대상으로 한 연구에서는 결장암(colon cancer) 73%, 위암(gastric cancer) 49%의 일치율을 보고했습니다. 길의료원에서 진행된 한국 연구에서는 결장암의 절대적 일치율을 48.9%로 나타냈으며, 수용 가능한 것으로 판단된 사례를 포함할 경우 65.8%로 상승했습니다. 위암에 대한 동일한 분석에서는 권장 수준에서 41.5%, 고려 대상 수준에서 87.7%의 일치율을 보고했습니다.
이 숫자들을 개별적으로 보지 말고 하나의 집단으로서 읽어야 합니다. 동일한 시스템이 동일한 종류의 질문을 받았음에도 불구하고, 한 환경에서는 열 번 중 아홉 번 이상 현지 관행과 일치하지만, 다른 환경에서는 절반도 안 되는 확률로 일치합니다.
흥미로운 점은 시스템이 나빴다는 것이 아닙니다. 일치도(concordance)가 애초에 의학적 정확성(medical correctness)을 측정하고 있지 않았다는 점입니다. 그것은 한 기관의 부호화된 관행(encoded practice)과 다른 기관의 관행 사이의 거리를 측정하고 있었습니다. 현지 관행이 훈련 기관과 유사한 곳에서는 높은 일치도를 보이고, 그렇지 않은 곳에서는 낮은 일치도를 보였습니다. 이는 동일한 원인을 공유하는 두 요소 사이의 공분산(covariance)이며, 정확도 점수(accuracy score)처럼 보이고 유사도 점수(similarity score)처럼 작동하는 수치를 만들어냅니다.
이 지표를 오직 내부에서만 측정하는 조직은 매번 높은 수치를 보게 될 것이며, 그 과정에서 아무것도 배우지 못할 것입니다.
내부 수치가 그토록 설득력 있는 이유
이 문제를 부주의함의 문제로 치부하면 마음이 편하겠지만, 내부 수치가 설득력을 갖는 이유는 똑똑하고 주의 깊은 사람이라도 빠져들 수밖에 없는 이유 때문입니다.
첫 번째 이유는 그것이 부정확하지 않기 때문입니다. 자신의 기관에서 원하는 만큼 소수점 자리까지 일치도를 측정할 수 있으며, 그 모든 수치는 정확합니다. 정밀도(precision)는 실재합니다. 다만 잘못된 양(quantity)에 붙어 있을 뿐입니다. 잘못된 추정량(estimand)에 대한 높은 정밀도는 내부에서 보기에 마치 엄격함(rigor)처럼 느껴지며, 자신감 넘치는 차트들을 만들어냅니다.
두 번째 이유는 평가를 수행하는 사람들이 바로 훈련 신호(training signal)를 제공한 사람들이라는 점입니다. 시스템이 그들과 의견이 다를 때, 그 자리에서의 자연스러운 해석은 시스템이 실수했다는 것입니다. 왜냐하면 그 자리에서는 실제로 시스템이 실수한 것이기 때문입니다. 불일치는 오류로 기록되고 수정되어 사라집니다. 따라서 평가 루프(evaluation loop)는 시스템이 어느 방향으로 움직이는지에 대해 중립적이지 않습니다. 이는 현지 관행으로의 수렴(convergence)에 보상을 주며, 이는 당신이 이미 믿고 있는 것 이외의 어떤 것도 알려줄 수 없도록 시스템의 능력을 파괴하는 것과 동일한 작업입니다.
세 번째는 건물 내의 그 누구도 구성원 모두를 당혹스럽게 만들 숫자를 만들어낼 유인이 없다는 점입니다. 외부 파일럿(external pilot)만이 결과에 이해관계가 없는 프로세스의 유일한 당사자입니다. 이는 인간의 성격에 대한 냉소적인 지적이 아닙니다. 이는 반증(disconfirming evidence)이 어디에서 오는가에 대한 구조적인 지점이며, 이것이 바로 "우리는 내부적으로 검증했다"라는 말이 증거라기보다는 절차에 대한 설명인 이유입니다.
당신의 분야에서도 발생하는 동일한 버그
종양학(oncology)이 멀게 느껴진다면, 계수(coefficient)가 포함된 버전은 다음과 같습니다.
2024년에 Scale AI의 한 팀은 널리 사용되는 초등 수학 벤치마크인 GSM8k의 스타일과 난이도를 반영하도록 설계된 새로운 벤치마크인 GSM1k를 구축했습니다. 목적은 GSM8k가 스스로에 대해 더 이상 답할 수 없는 질문을 던지는 것이었습니다. 즉, 모델이 높은 점수를 받을 때, 그중 얼마만큼이 산술적 추론 (arithmetic reasoning)이고 얼마만큼이 테스트를 이미 보았기 때문인가 하는 점입니다.
그들의 논문인 "A Careful Examination of Large Language Model Performance on Grade School Arithmetic"에 따르면, 모델이 GSM8k에서 새로운 세트로 이동할 때 정확도가 최대 8%까지 하락한다고 보고합니다. 여러 모델 제품군(model families)이 거의 모든 크기에 걸쳐 체계적인 과적합 (overfitting)을 보여줍니다. 그리고 이를 단순한 의심 이상의 사실로 만드는 발견은 다음과 같습니다. 모델이 GSM8k 예시를 생성할 가능성과 홀드아웃 세트 (held-out set)에서의 점수 하락 폭 사이에 양의 상관관계(Spearman's r² = 0.36)가 존재한다는 것입니다. 테스트 내용을 암기할 수 있는 모델일수록 테스트가 바뀌었을 때 성능이 더 떨어집니다.
그 계수야말로 원칙에 관한 논쟁을 측정값으로 바꾸는 요소입니다. 벤치마크 점수는 능력 (capability)과 노출 (exposure)의 결합된 측정치이며, 점수 내부의 그 어떤 것도 그 비율을 알려주지 않습니다.
이 과정에서 어긋난 세 가지 숫자
이 글을 작성하는 동안 우리는 자체 소스에서 세 번이나 이 논지에 부딪혔습니다.
GSM1k의 정확도 하락은 많은 2차 보도에서 13%로 보고되었습니다. 하지만 논문의 초록(abstract)에서는 최대 8%라고 명시되어 있습니다. 우리는 1차 자료(primary)를 따랐습니다.
텍사스 대학교(University of Texas)의 감사 보고서는 여러 재구성된 이야기들에서 2016년 1월 31일에 게시된 것으로 묘사되는데, 이는 옳을 수 없습니다. 왜냐하면 감사가 다루는 사건들이 2016년 9월까지 이어지기 때문입니다. 게시 날짜는 2017년 1월 31일입니다. 전달 과정에서 1년이 빠진 것입니다.
IBM과 프로젝트를 지원한 컨설팅 업체 사이의 6,200만 달러 배분은 기록마다 약간씩 다르게 나타납니다. 총액은 일정하게 유지되지만, IBM에 약 3,900만4,000만 달러, 컨설팅 업체에 약 2,100만2,300만 달러가 배정되었다고 합니다. 이것이 바로 여기서 수치가 정확한 합계가 아니라, 보고서 자체의 완곡한 표현(hedge)인 "최소 6,200만 달러"로 기재된 이유입니다.
이러한 수치의 편차들은 그 어떤 것도 추문(scandalous)이 아닙니다. 각 기록은 연구나 감사가 발견한 내용을 보고하기 위해 정직하게 최선을 다했습니다. 그것이 핵심입니다. 숫자가 잘못된 결론에 도달하기 위해 누군가가 거짓말을 할 필요는 없습니다. 그저 출처로 돌아가지 않은 사람들이 몇 번 복사하기만 하면 되며, 각각의 복사본은 개별적으로는 합리적입니다.
이 논리의 게으른 버전은 틀렸기에 제시하는 대조군
GSM1k 논문은 또한 프런티어 모델(frontier models)이 과적합 (overfitting)의 징후를 거의 보이지 않는다는 점을 발견했습니다. 모델들은 학습 데이터(training data)에 존재하지 않음이 보장된 문제들에 대해서도 일반화 (generalize) 능력을 보여주었습니다.
이는 중요한 문제이며, 이를 누락하는 것은 이 에세이가 다루고자 하는 죄악과 같습니다. 정직한 주장은 벤치마크 (benchmarks)가 연극이라거나 측정된 진보가 가짜라는 것이 아닙니다. 실제적인 능력 향상은 존재하며, 오염 (contamination)을 수치화하는 바로 그 연구가 이를 입증하기도 합니다.
주장은 더 좁고 유용합니다. 측정된 개선은 당신이 변경한 요소가 유일하게 움직인 요소일 때에만 인과적 해석 (causal reading)을 허용합니다. 당신의 평가 (evaluation)가 기관, 시장 체제, 또는 스크래핑된 말뭉치 (scraped corpus)와 같은 학습 소스를 공유한다면, 당신이 관찰하는 일치도의 일부는 메아리 (echo)이며, 점수만으로는 그 양이 얼마인지 알 수 없습니다.
기저율 (base rate)이었던 제로
다음은 오늘 아침 우리가 거의 놓칠 뻔했던 버전입니다.
2026년 7월 27일, 연구 질문을 수행하던 중 우리는 특정 종류의 숙련된 노동이 AI 도입의 영향을 받았는지에 대해 데이터에 기반한 해석을 원했습니다. Anthropic Economic Index는 과업 침투율 (task penetration) 및 직업 노출 (job exposure) 데이터를 포함한 노동 시장 영향 보고서를 발행하므로, 우리는 과업 수준 (task-level) 파일을 추출하여 그 안에 포함된 모든 교정 (calibration) 및 계측 (metrology) 과업을 살펴보았습니다.
모든 항목이 0.0으로 읽혔습니다.
이는 놀라운 결과입니다. 이 업무에 대한 AI 침투율을 측정했을 때 0이었습니다. 이는 아주 훌륭한 문장이 될 것이었고, 우리는 거의 그것을 작성할 뻔했습니다.
그 후 우리는 파일의 나머지 부분을 집계했습니다. 우리가 해당 파일을 집계한 결과, 17,998개의 과업 진술 중 0이 아닌 값을 가진 것은 1,354개뿐이었습니다. 파일의 약 92.5%가 0.0으로 읽혔습니다. 우리의 발견은 데이터셋의 최빈값 (modal value)이었습니다. 우리는 파일의 희소성 (sparsity)을 측정하고 있었으며, 이를 특정 직업에 대한 사실로서 보고하려던 참이었습니다.
해결책은 분포가 실제로 차별성을 보이는 직업 수준 (occupation-level) 파일로 이동하는 것이었습니다. 우리의 집계에 따르면, 756개 직업에 걸쳐 평균은 0.0770이었으며, 54.4%가 정확히 0에 머물러 있었습니다. 그곳에서 관련 대리 지표 (proxies)는 0.0324와 0.0으로 읽혔습니다. 여전히 낮지만, 이제는 비교할 수 있는 분포 (spread)가 존재하기 때문에 의미 있게 낮은 수치입니다.
0이라는 값은 변하지 않았습니다. 변한 것은 그 값이 추출된 모집단 내에서 0이 얼마나 평범한 것인지 알게 되었다는 점입니다.
변화량 (delta)을 믿기 전에 계산해야 할 것
이 네 가지 사례를 모두 잡아낼 수 있는 점검 방법은 간단하며, 숫자가 슬라이드에 들어가기 전에 실행해 볼 가치가 있습니다.
측정 기간 동안 다른 무엇이 변했는지 물으십시오. 만약 대답이 "내가 변경한 것 외에는 아무것도 없다"가 아니라면, 그 개선은 공분산 (covariance)이며, 독자가 다르게 추측하게 두는 대신 이를 명시적으로 말해야 합니다.
값이 추출된 모집단에서 해당 값의 기저율 (base rate)이 무엇인지 물으십시오. 극단적인 수치는 그 수치가 얼마나 흔한지 알기 전까지는 아무런 의미가 없습니다. 대부분이 0인 파일에서 추출된 0은 파일에 대한 묘사일 뿐입니다.
새로운 샘플이 무엇이라고 말할지 물어보십시오. 훈련 데이터가 가진 모든 편향(bias)을 공유하는 동일한 컬렉션의 홀드아웃 분할(held-out split)이 아니라, GSM8k를 상속받지 않으면서도 이를 반영하도록 구축된 GSM1k의 방식처럼 독립적으로 확보된 매칭 샘플(matched sample)을 요구하십시오. 만약 이를 확보하는 것이 비현실적이라면, 그것은 실제적인 제약 사항이며 명시할 가치가 있습니다. 용납할 수 없는 것은, 단 한 번도 새로운 샘플을 확보하지 못했다는 사실조차 인지하지 못한 채 4년의 시간과 6,200만 달러를 소비하는 것입니다.
세 가지 질문이 있습니다. 이 중 어떤 것도 새로운 도구(tooling)를 필요로 하지 않으며, 이 중 어느 것이라도 2014년 휴스턴의 누군가는 손을 들어 질문했을 것입니다.
출처 (Sources)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기