KAISEN: 임상 위험 모델을 위한 재현 가능한 하위 그룹 공정성 감사
요약
임상 위험 모델의 하위 그룹 공정성을 검증하기 위한 5단계 감사 파이프라인인 KAISEN을 제안합니다. 합성 벤치마크를 통해 계층화, 불균형 측정, 메커니즘 진단 등 감사 구성 요소의 신뢰성과 한계를 체계적으로 평가했습니다.
핵심 포인트
- KAISEN: 5단계(계층화, 측정, 진단, 완화, 모니터링) 감사 파이프라인 제안
- 그룹별 임계값 최적화는 EOD를 감소시키나, Platt scaling은 효과가 불분명함
- 메커니즘 진단은 대리 변수 오지정 상황에서 복구 및 탐지에 실패함
- CUSUM 모니터링 시 코호트 변화에 따른 허위 경보 및 탐지 실패 발생 가능성 확인
임상 위험 모델(Clinical risk models)은 일반적으로 강력한 집계 성능(aggregate performance)을 달성하지만, 환자 하위 그룹(patient subgroups)에 따라 실질적으로 다른 오류율을 생성합니다. 이를 포착하기 위해 감사 파이프라인(Audit pipelines)이 제안되었으나, 그 구성 요소들이 스트레스 테스트(stress-tested)를 거치는 경우는 드물기 때문에, 감사의 어떤 부분이 어떤 조건에서 신뢰될 수 있는지 불분명합니다. 우리는 하위 그룹 계층화(subgroup stratification), 불균형 측정(disparity measurement), 메커니즘 진단(mechanism diagnostics), 사후 완화(post-hoc mitigation), 그리고 드리프트 모니터링(drift monitoring)을 아우르는 5단계 감사 파이프라인인 KAISEN을 제시하며, 이를 16개의 질병 작업, Healthy People 2030의 15개 사회적 결정 요인 축(social-determinant axes), 그리고 3개의 사전 지정된 교차점(intersections)으로 구성된 합성 벤치마크(synthetic benchmark)에서 실패 지점까지 평가했습니다. 네 가지 결과는 다음과 같습니다. (i) 유의성(Significance)은 각 축의 자체 최소 탐지 가능 효과(minimum detectable effect) 대비 격차를 추적합니다: 15개 축 전체에서 유의성 횟수와 원시 등가 기회 차이(equalized-odds difference, EOD) 사이의 순위 상관관계(rank correlation)는 rho = 0.56이며, EOD를 해당 하한선으로 표준화하면 rho = 0.78로 상승합니다. (ii) 그룹별 임계값 최적화(Per-group threshold optimization)는 48개의 홀드아웃 실행 중 48개 모두에서 EOD를 감소시켰으나(paired delta = -0.285, 95% CI [-0.313, -0.252]), 더 나은 보정기(calibrator)인 그룹별 Platt scaling은 EOD 측면에서 동전 던지기처럼 동작하여(48개 실행 중 19개 개선, 95% CI [0.26, 0.55]), 평균 효과가 0에 가깝습니다. 따라서 감사가 보고해야 할 것은 평균이 아니라 분산(variance)입니다. (iii) 메커니즘 진단(mechanism diagnostic)은 144개의 통제된 사례 중 144개를 정확하게 분류했지만, 대리 변수 오지정(proxy misspecification) 하의 모델 주도 사례 48개 중 어느 것도 복구하지 못했으며, 실패했다는 신호도 없었습니다. (iv) CUSUM 실패와 허위 경보(false alarms)는 질병보다 코호트 실현(cohort realization)을 훨씬 더 많이 추적합니다: 기준 임계값에서, 27개의 허위 경보와 8개의 놓친 변화 중 7개가 서로 다른 시드(seeds)에서 발생했습니다(chi-squared p = 0.002). 즉, 한 코호트에서 조정된 임계값은 전이(transfer)되지 않습니다. 모든 결과는 기저 사실(ground truth)을 알고 있는 합성 데이터이며 임상적 타당성을 입증하지는 않습니다. 모든 수치를 재현하는 코드, 결과물 및 스크립트가 공개되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기