결정론적 매칭(Deterministic Matching)의 한계: AI를 활용한 환자 기록 정제 및 매칭
요약
의료 데이터 관리에서 발생하는 중복 환자 기록 문제를 해결하기 위해 결정론적 매칭의 한계를 분석합니다. 단순 규칙 기반 매칭을 넘어 데이터 정제와 식별자 활용의 중요성을 다룹니다.
핵심 포인트
- 중복된 환자 기록은 데이터 위생을 넘어 인증 의무의 문제임
- IHI와 같은 고유 식별자도 만능이 아니므로 결함을 고려한 설계 필요
- 결정론적 계층(정규화, 블록 생성, 비교)을 통한 기초 데이터 정제 중요
하나 이상의 시스템을 운영하는 모든 조직은 결국 동일한 인물을 여러 번 보유하게 됩니다. 이름이 축약되어 있고 생년월일이 없는 상태로 의뢰가 도착합니다. 환자 관리 시스템(Patient Administration System)에는 이전 주소로 등록되어 있습니다. 청구 시스템에는 2019년 전화 예약 시 발생한 오타가 있습니다. 접수처 직원은 검색 결과가 유용하지 않자 새로운 기록을 생성하고, 이제 네 개의 기록이 존재하게 됩니다.
이 포스트는 Practical AI in Health 시리즈의 일부이며, 시리즈 전체에서 가장 화려하지 않은 작업, 즉 무언가를 그 위에 구축하기 전에 기록들이 한 사람이 누구인지에 대해 일치하도록 만드는 과정을 다룹니다.
매칭은 단순한 데이터 위생이 아닌 인증 의무입니다
NSQHS 표준 6(Standard 6)은 보건 서비스 조직이 등록 시, 모든 진료 시점, 그리고 인수인계, 전원 및 퇴원 문서에서 최소 세 가지의 승인된 환자 식별자(Patient Identifiers)를 사용할 것을 요구합니다. 병실 번호, 침대 번호 및 진단명은 명시적으로 승인되지 않은 식별자입니다. 액션 6.6(Action 6.6)은 더 나아가 조직이 환자를 의도된 진료에 매칭하는 데 사용된 프로세스를 문서화할 것을 요구합니다 (ACSQHC).
마지막 지점은 엔지니어링 방식을 변화시킵니다. 귀하의 매칭 설계는 평가자가 확인을 요청할 수 있는 산출물(Artefact)입니다. 만약 답변이 "벤더의 알고리즘이 처리합니다"라면, 귀하는 데이터 문제뿐만 아니라 문서화 문제도 안고 있는 것입니다.
실제로 유효한 식별자부터 시작하십시오
개인 의료 식별자(Individual Healthcare Identifier, IHI)는 Medicare 또는 DVA에 등록된 모든 사람에게 자동으로 부여되는 16자리 번호이며, 평생 유지됩니다. Medicare 번호는 그렇지 않습니다. 한 사람이 평생 동안 여러 개의 번호를 보유할 수 있으며, 이것이 바로 해당 번호를 키(key)로 사용하는 많은 시스템에서 중복 데이터가 발생하는 정확한 이유입니다 (Australian Digital Health Agency).
IHI라고 해서 만능인 것도 아닙니다. ADHA의 National Healthcare Identifiers Roadmap 2023-2028에서는 현재 해결 중인 결함들을 명시하고 있는데, 여기에는 검색 결과에 나타나는 만료된 IHI 기록, 메시지 검색 실패, 제 역할을 하지 못하는 식별자 상태 플래그(identifier status flags), 그리고 애보리진 및 토레스 해협 섬 주민(Aboriginal and Torres Strait Islander peoples)에 대한 낮은 매칭 결과 등이 포함됩니다. 반환된 식별자가 유효하지 않을 수 있다는 가정하에 설계하십시오.
결정론적 계층(Deterministic layer)이 대부분의 작업을 처리합니다
대부분의 중복 쌍은 지루할 정도로 단순하며 규칙(rules)으로 해결 가능합니다. 먼저 정규화(Normalise)하고, 그다음 블록(block)을 생성한 뒤, 비교(compare)하십시오. 특정 소스 시스템이 아닌 통합 계층(integration layer) 내부에서 다음과 같이 실행됩니다:
// 1. 신뢰할 수 있는 식별자 매칭: 자동 해결, 검토 불필요.
if (HasValue(a.Ihi) && a.Ihi == b.Ihi && a.IhiStatus == Active) return Verdict.Merge;
...
결정론적 계층이 추측만으로 병합하지 않도록 임계값(thresholds)을 조정하십시오. 그렇게 하면 대기열(queue)이 남게 되며, 그 대기열에 흥미로운 작업들이 쌓이게 됩니다.
회색 지대(Grey zone)는 어떤 모습인가
발표된 실제 매칭 방식의 비교 연구는 유용한 수치를 제공합니다. 확률적 매칭 (Probabilistic matching)은 0.6366의 민감도 (sensitivity)와 0.9995의 양성 예측도 (positive predictive value, PPV)를 기록했습니다. 참조 매칭 (Referential matching)은 0.9351의 민감도와 0.9996의 PPV를 기록했습니다 (Grannis et al., JAMIA 2022). 이 두 열을 함께 읽어보십시오. 조정된 매칭 (Tuned matching)은 서로 다른 두 사람을 병합하는 경우가 거의 없습니다. 대신 매칭을 놓치게 되는데, 확률적 매칭의 경우 그중 3분의 1을 놓칩니다.
놓친 매칭은 중복 데이터 (duplicates)가 됩니다. 중복 데이터는 임상의가 환자 기록의 일부만 보게 되고, 소환 서신 (recall letter)이 한 기록에는 발송되지만 다른 기록에는 발송되지 않으며, 보고서에는 한 사람이 두 명으로 집계됨을 의미합니다.
LLM이 제 역할을 하는 곳
결정론적 계층 (deterministic layer)을 통과하여 살아남은 후보 쌍들은 대개 인간이 설명할 수 있는 특정한 이유 때문에 판단이 어렵습니다. 문화적으로 다양한 환자군에서 이름과 성이 뒤바뀐 경우, 한 시스템에는 결혼 후 성(married name)이 있고 다른 시스템에는 동일한 생년월일을 가진 결혼 전 성(maiden name)이 있는 경우, 한 주소지에 거주하며 생년월일이 서로 다른 연도에 단 6일 차이로 기록된 두 형제/자매가 있는 경우 등이 있습니다. 또한, 소스 시스템이 하나의 이름을 두 개의 필드로 나누어 기록한 외명(mononymous) 사용자의 경우, HL7 식별 매칭 가이드라인(HL7 Interoperable Digital Identity and Patient Matching IG)에 따르면 성(last-name) 필드에 제출해야 합니다.
LLM은 정확히 이러한 좁은 범위의 판결 (adjudication)에 능숙합니다. 즉, 두 기록을 읽고, 증거를 검토하며, 검토자가 수락하거나 거부할 수 있는 문장으로 그 근거를 설명하는 것입니다. 시스템을 구축하기 전에 현재의 연구들을 읽어볼 가치가 있는데, 이는 작업의 프레임워크 (framing)가 모델의 선택만큼이나 결과에 큰 영향을 미치기 때문입니다. 쌍별 매칭 (Pairwise match), 비교 (comparison), 선택 (selection) 공식화는 모두 서로 다른 성능을 보입니다 (Wang et al., COLING 2025).
우리가 타협할 수 없는 두 가지 설계 요구사항입니다. 모델은 절대로 병합(merge)을 직접 수행하지 않습니다. 모델은 대기열(queue)의 순위를 매기고 근거(justification)를 초안 형태로 작성하며, 지정된 사람이 각 병합을 승인합니다. 이때 결정 사항과 그 근거는 골든 레코드(golden record)에 함께 저장됩니다. 또한 모든 병합은 되돌릴 수 있어야 합니다. 왜냐냐하면 일부 병합은 다시 취소(unmerging)해야 할 상황이 발생하기 때문입니다.
알고리즘 선택보다 중요한 필드 완결성 (Field completeness)
AIHW의 COVID-19 연계 데이터 세트는 모든 관할 구역에서 90% 이상의 연계율(linkage)을 달성했습니다. 태즈메이니아(Tasmania)가 99%로 가장 높았으며, 빅토리아(Victoria)는 2,536,790명으로 가장 많은 물량을 처리했습니다. 노던 테리토리(Northern Territory)는 뒤처졌는데, 명시된 이유는 제한적인 주소 정보 때문이었습니다 (AIHW). 어떤 모델도 비어 있는 필드를 채워줄 수는 없습니다.
동일한 분석 결과, 70세 이상의 연령층에서 연계되지 않은 기록의 비율이 9.9%로 가장 높게 나타났으며, 성별이 일관되지 않게 기록되었거나 '기타(Other)'로 기록된 경우 연계율이 떨어졌습니다. 매칭 실패는 고령 환자와 인구 통계 정보가 이진 값(two-value) 필드에 부합하지 않는 사람들에게 불균형적으로 발생합니다. 매칭률을 단순히 합계로만 보고하지 말고 코호트(cohort)별로 보고하십시오. 그렇지 않으면 문제를 결코 파악할 수 없을 것입니다.
통합 아키텍처 (The integration architecture)
우리는 이를 소스 시스템 내부가 아닌, 소스 시스템 옆의 레이어로 구축합니다. 이를 위해 MIT 라이선스 기반의 C# 통합 및 마스터 데이터 플랫폼인 Centazio를 사용합니다.
- 소스(Sources)는 Centazio에 변경 사항을 게시하며, Centazio는 결함 허용(fault tolerance) 및 중앙 데이터베이스로의 실시간에 가까운(near real time) 전달을 처리합니다.
- 레코드(Records)는 정형화된 환자 형태(canonical Patient shape)로 저장됩니다. CSIRO가 주도하는 Sparked 액셀러레이터(accelerator)가 FHIR R4를 기반으로 구축한 AU Core v1.0.0이 합리적인 대상입니다. 이 모델의 한계에 유의하십시오: Patient는 과거의 이름과 주소를 포함하지만, 생년월일(birthDate)은 단 하나만 가집니다.
- 결정론적 규칙(Deterministic rules)이 쓰기 작업 시 실행되어 병합(merges), 거부(rejections) 및 검토 대기열(review queue)을 생성합니다.
- LLM 판정관(adjudicator)이 대기열의 점수를 매기고 이유를 설명합니다. 최종 결정은 사람이 합니다.
- 골든 레코드(golden record)는 모든 소스 식별자(source identifier)를 교차 참조(cross reference)로 유지하므로, 아무것도 파괴되지 않으며 모든 병합 과정을 되돌아갈 수 있습니다.
- 매칭 결과는 FHIR
Patient/$match연산을 통해 제공되며, 이는 매칭 등급(match grade)이 포함된 점수화된 번들(scored bundle)을 반환합니다. 기본 사양(base specification)은 의도적으로 특정 알고리즘이나 최소 입력 데이터 세트를 규정하지 않으므로, 정확도는 전적으로 사용자의 책임이며 문서화해야 합니다.
Centazio는 이러한 종류의 작업을 통해 탄생했습니다. Cruising Yacht Club of Australia에서는 초기 교차 시스템 보고 대시보드가 Centazio를 통해 시스템이 통합된 5개년 전환 계획으로 발전했으며, Guide Dogs NSW/ACT를 포함한 고객들을 위해 유사한 통합 역할을 수행하고 있습니다.
비용, 한계 및 컴플라이언스 시계
토큰 비용(Token cost)은 비싼 부분이 아닙니다. LLM은 모호한 영역(grey zone)만을 확인하며, 그 영역은 작기 때문입니다. 실제 예산 항목은 검토자(Reviewer)의 시간입니다. 따라서 누군가에게 타임라인을 약속하기 전에 대기열의 규모를 산정하십시오. 과거 데이터에 대해서는 초기 단계에서 대량의 작업이 발생할 것이며, 안정 상태(steady state)에 접어들면 작업량이 훨씬 줄어들 것으로 예상해야 합니다.
계획해야 할 날짜도 있습니다. 2024년 개인정보 및 기타 법률 개정안(Privacy and Other Legislation Amendment Act 2024)은 APP 1.7을 삽입하여, 개인의 권리나 이익에 영향을 미치는 자동화된 의사결정(automated decision making)을 개인정보 처리방침에 공개하도록 요구합니다. 이는 2026년 12월 10일부터 시행되며, 위반 시 위반 건당 최대 $66,000의 위반 통지(infringement notices)가 부과될 수 있습니다 (MinterEllison). 두 기록이 동일 인물인지에 대한 AI 보조 의사결정(AI-assisted decision)도 이 범위에 포함됩니다.
중복 기록을 그대로 두는 것 또한 안전한 선택이 아닙니다. 보건 서비스 제공자(Health service providers)는 OAIC의 2025년 데이터 침해 통계에서 총 1,205건 중 19%인 225건의 통지를 기록하며 가장 많은 통지를 받은 부문이었으며, 1월부터 6월 사이의 침해 사례 중 37%는 인적 오류(human error)로 인해 발생했습니다 (OAIC). 파편화된 기록은 잘못된 문서를 잘못된 사람에게 보낼 수 있는 지점이 더 많음을 의미합니다.
측정부터 시작하십시오. 운영 데이터(production)의 복사본에 결정론적 규칙(deterministic rules)을 실행하여, 자동 병합(auto-merges) 건수와 회색 지대(grey zone)의 건수를 산출하고, 숙련된 직원 2명이 200쌍의 샘플을 검토하게 하십시오. 이를 통해 기준점(baseline), 대기열 크기(queue size), 그리고 학습 세트(training set)를 확보할 수 있으며, 이는 몇 분기(quarters)가 아닌 몇 주(weeks) 만에 완료할 수 있는 작업입니다.
PicNet은 호주 기업들을 위한 운영용 AI 시스템을 구축합니다. 첫 번째 프로젝트가 어떤 모습일지 저희에게 문의해 주세요.
원문은 picnet.com.au에서 처음 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기