AI를 활용한 임상 및 의뢰 문서 요약
요약
의료 문서의 누락된 정보를 방지하기 위해 AI를 활용한 구조화된 데이터 추출 시스템 구축 방법을 제안합니다. 단순 요약 대신 OCR, 세분화, 개체 추출, 스키마 매핑을 거치는 파이프라인을 통해 검증 가능한 데이터를 생성하는 아키텍처를 다룹니다.
핵심 포인트
- 단순 산문 요약 대신 구조화된 데이터 추출 방식 권장
- OCR, 청킹, 개체 및 관계 추출을 통한 데이터 정밀도 향상
- 검증 가능한 필드 중심의 파이프라인 설계 중요성
- 결정론적 세분화 및 고정 스키마를 통한 데이터 무결성 확보
우리가 대화하는 모든 의료 서비스 기관은 동일한 문제에 직면해 있습니다. 팩스로 전송된 PDF, 스캔된 필기체, 이메일 첨부 파일로 도착하는 의뢰서(referrals), 그리고 긴 교대 근무 끝에 작성되는 퇴원 요약지(discharge summaries)가 쌓여 있습니다. 누군가는 이 모든 것을 읽고 매번 동일한 수십 가지의 사실을 추출해야 합니다. 이는 느리고, 지루하며, 중요한 사항을 놓치게 만듭니다.
누락된 부분은 문서로 기록되어 있습니다. 호주의 국가 가이드라인(Australian National Guidelines)에 따라 3차 의료 종양학 부서를 대상으로 실시한 사후 감사(retrospective audit) 결과, 퇴원 요약지의 82%에서 "절차(procedures)"가 누락되었고, 38%에서 "중단된 약물(ceased medicine)"이, 8%에서 "환자에게 제공된 정보(information provided to the patient)"가 누락된 것으로 나타났습니다. 추적 관찰(Follow-up) 계획은 요약지의 91%에 기록되어 있었지만, 정확한 예약 날짜는 누락되는 경우가 많았습니다. 이것이 바로 우리가 해결해야 할 문제이며, 행정적인 문제입니다.
이 포스트는 우리의 Practical AI in Health 시리즈의 일부입니다. 여기에서는 임상 거버넌스 위원회(clinical governance committee)의 검토를 통과할 수 있는 문서 요약 시스템을 어떻게 구축하는지 다루고자 합니다.
먼저 추출하고, 그 다음에 산문(prose)을 작성하라
가장 흔한 실수는 문서 전체를 모델에 전달하고 요약을 요청하는 것입니다. 그렇게 하면 유창한 문단이 생성되지만, 그 누구도 무엇을 기준으로 검증할 수 없습니다.
대안은 이 작업을 구조화된 추출(structured extraction)로 취급하는 것입니다. 문서를 세그먼트(segments)로 나누고, 각 세그먼트에서 개체명(named entities)과 관계(relations)를 추출한 다음, 결과를 이미 사용 중인 스키마(schema)에 매핑하고, 그 후에 구조화된 기록으로부터 읽기 쉬운 텍스트를 생성하는 방식입니다. 정확히 이 방식(OCR, 청킹(chunking), 개체 및 관계 추출, 그 후 FHIR R4 및 OMOP로 매핑)을 수행하는 공개된 파이프라인은 5,789개의 추출된 약물을 대상으로 7개 약물 데이터 필드에서 약 95%의 정확도(accuracy)와 F1 점수를 기록했다고 보고했습니다. 비록 검증 대상이 34명의 환자에 불과한 소규모 코호트(cohort)였지만, 설계의 핵심은 명확합니다. 검증할 수 없는 산문(prose)보다는 검증 가능한 필드(fields)가 훨씬 낫다는 점입니다.
작동하는 아키텍처(architecture)는 다음과 같습니다:
- 모든 추출된 값에 대해 원본 페이지 이미지를 유지하며 수행하는 데이터 수집(Ingest) 및 OCR.
- 모델이 텍스트를 보기 전에 섹션별로 수행하는 결정론적 세분화 (Deterministic segmentation).
- 고정된 스키마 (fixed schema)를 반환하며, 소스 내의 근거 구간 (supporting span) 없이는 값을 출력하지 않는 추출 단계 (extraction pass).
- 용어 집합 (terminology sets), 날짜 로직 및 내부 일관성에 대한 검증 (입원 목록에 전혀 나타나지 않는 중단된 약물은 사실이 아니라 플래그 (flag)로 처리됨).
- 누락된 필수 필드를 나열하는 완전성 검사 (completeness check). 누락 (absence)은 가장 빈번하게 맞닥뜨리게 될 실패 모드 (failure mode)이기 때문입니다.
- 원본 문서가 아닌, 검증된 구조로만 제한된 서술 단계 (narrative pass).
- 임상의나 접수 담당자가 인용된 소스 텍스트 옆에 각 필드를 확인하고, 승인 또는 수정 후 최종 서명하는 검토 화면.
우리의 추출 출력물은 다음과 같은 형태를 띱니다:
{
"field": "ceased_medicines",
"value": ["metoprolol 25 mg BD"],
...
근거 구간 (span)이 없으면 필드도 없습니다. 이는 지루한 규칙이지만, 나중에 발생할 수 있는 논쟁의 한 부류를 완전히 제거해 줍니다.
실제로 무엇이 잘못되는가
조작 (Fabrication)이 헤드라인을 장식하지만, 누락 (omission)이 더 빈번한 문제입니다. 18개의 실험적 구성과 12,999개의 임상의 주석 문장을 다룬 벤더 중립적 평가(vendor-neutral evaluation)에 따르면, 1.47%의 환각률 (hallucination rate)과 3.45%의 누락률 (omission rate)이 측정되었습니다. 누군가 완벽함을 요구할 때 동일한 논문의 베이스라인을 염두에 둘 가치가 있습니다. 사람이 작성한 노트는 평균적으로 약 1개의 오류와 4개의 누락을 포함하며, 이전의 BART 기반 모델은 노트당 3.9개의 오류와 6.6개의 누락을 생성했습니다. 여러분의 검토 프로세스는 "무엇을 지어냈는가?"만큼이나 "무엇을 빠뜨렸는가?"를 최소한 같은 빈도로 질문해야 합니다.
그라운딩 (Grounding)은 있으면 좋은 기능이 아닙니다. 연구자들이 의사가 설계한 300개의 사례 (vignettes)를 구축하고 각 사례에 조작된 단일 검사 수치, 징후 또는 질병을 심었을 때, 모델은 기본 프롬프트 하에서 최대 83%의 사례에서 심어진 오류를 반복하거나 상세화했으며, 전체 환각 (hallucination) 발생률은 65.9%에 달했습니다. 완화 프롬프트를 사용했을 때 이 수치는 44.2%로 낮아졌습니다. 여기서 두 가지 결론이 도출됩니다. 프롬프트 엔지니어링 (Prompt engineering)이 도움이 되기는 하지만 결코 충분하지 않다는 점입니다. 그리고 의뢰서 (referrals)에는 이미 오류가 포함되어 있으므로, 소스 텍스트 위에서 자유롭게 실행되는 모든 파이프라인은 해당 오류들을 여러분의 기록으로 자신 있게 세탁하여 전달할 것입니다.
신뢰도 플래그 (Confidence flags)는 도입할 가치가 있지만, 그것이 무엇인지에 대해 정직해야 합니다. 모델이 스스로 보고하는 신뢰도 수치는 그 자체만으로는 거의 의미가 없습니다. 실제로 효과가 있는 방법은 두 번의 독립적인 추출 단계 (extraction passes) 간의 일치 여부, 일치하는 소스 범위 (source span)가 발견되었는지 여부, 그리고 해당 값이 용어 집합 (terminology set)에 따라 유효한지 여부입니다. 이 요소들을 결합하여 임계값 (threshold)을 설정하고, 그 미만의 모든 항목은 사람에게 전달하십시오. 임계값 이상의 항목 또한 사람에게 전달하되, 마찰을 줄이는 방식으로 처리하십시오.
의뢰서를 구조화하고, 임상의가 분류(triage)하게 하라
한 걸음 더 나아가 시스템이 긴급도를 할당하게 만들고 싶은 유혹이 생길 수 있습니다. Queensland Health 연구진은 2019년에서 2022년 사이 두 병원에서 발생한 17,378건의 이비인후과 (ENT) 의뢰서를 임상 우선순위 기준 (Clinical Prioritisation Criteria)에 따라 자동 분류하는 실험을 진행했으나, 실제 할당된 분류 범주와 53.8%의 일치율을 기록했습니다. 의뢰서 내용의 추출은 충분히 해결된 공학적 문제에 가깝습니다. 하지만 긴급도를 할당하는 것은 그렇지 않으며, 그 결정을 내리는 임상의는 하단의 면책 조항이 아닌 설계 요구 사항 (design requirement)이 되어야 합니다.
건강 정보를 온쇼어 (onshore)로 유지하기
OAIC의 2024년 10월 가이드라인은 조직이 상용 AI 제품에 개인 정보, 특히 민감한 정보(sensitive information)를 입력하지 말 것을 최선의 관행(best practice)으로 권고하며, APP 3, 6, 8, 10을 실질적인 의무 사항으로 지목하고 있습니다. 건강 정보는 민감한 정보입니다. 오프쇼어 (offshore) API 호출은 보건 서비스 기관이 책임을 져야 하는 국외 공개(cross-border disclosure)에 해당합니다. ACSQHC의 앰비언트 스크라이브 (ambient scribe) 시나리오는 훨씬 더 단호합니다. 환자가 오프쇼어 처리에 대해 명시적 동의 (explicit consent)를 제공하지 않는 한, 데이터는 반드시 호주 내에 저장 및 처리되어야 합니다.
이에 따라 세 가지 실질적인 옵션이 남습니다. 데이터 보존 및 학습에 대한 계약적 보장이 있는 호주 리전 (region)에 배포된 상용 API는 운영 비용이 가장 저렴하지만, 조달 및 개인정보 보호 관련 서류 작업이 가장 많이 필요합니다. 직접 제어하는 인프라에서 오픈 웨이트 (open-weight) 모델을 사용하는 것은 고정된 GPU 비용 지출과 자체적인 평가 (evaluation) 수행을 대가로, 데이터 거주성 (residency), 버전 안정성, 그리고 벤더가 모델을 임의로 변경하지 않는 환경을 제공합니다. 하이브리드 방식은 추출 및 비식별화 (de-identification)를 위해 더 작은 로컬 모델을 배치하고, 더 큰 모델은 비식별화된 텍스트만 보도록 하는 방식입니다. 이는 관리 요소(moving parts)를 늘리고, 완벽하다고 가정해서는 안 되는 비식별화 작업에 의존하게 됩니다.
비용 측면에서 토큰당 지출 (per-token spend)은 보통 가장 작은 항목입니다. 한 달에 수천 건의 문서라면, 임상의의 검토 시간 및 검증 (validation) 작업에 비하면 오차 범위 수준입니다. 셀프 호스팅 (self-hosting)은 비용을 고정된 GPU 시간으로 전환하며, 이는 대량 처리 시 또는 거주성 요구 사항이 결정을 대신해야 하는 상황에서 이점이 있습니다. 예산의 대부분은 추론 (inference)이 아닌 평가 (evaluation)를 위해 책정하십시오.
검증은 이동하지 않는다
Victoria의 2025년 5월 Ambient AI Scribes (주변 환경 AI 기록자) 부문 자문서는 최소한의 구현 표준을 설정하며, 한 가지 맥락에서 평가된 솔루션이 다른 임상 환경 간에, 또는 해외 교육 맥락에서 호주 의료 관행으로 전이될 수 있다고 가정할 수 없음을 명확히 밝히고 있습니다. 일반의 (GP) 의뢰서에서 높은 정확도를 보인다고 해서, 그것이 종양학이나 산과에서도 유효할지는 알 수 없습니다. 귀하의 자체 문서와 자체 임상의를 활용하여 전문 분야별 검증 (per-specialty validation)을 위한 예산을 책정하십시오.
로드맵도 주의 깊게 살펴봐야 합니다. TGA (호주 의료기기 규제국) 규제는 기술 중립적 (technology-agnostic)이며 의도된 목적에 따라 결정됩니다. 문서 초안을 작성하는 도구는 일반적으로 의료기기 (medical device)가 아니지만, TGA의 자체 사례에 따르면 상담 시 언급되지 않은 진단이나 치료를 제안하는 기능을 나중에 갖게 된 기록자 (scribe)는 그 시점에 규제 대상이 됩니다. TGA는 2025년 7월에 의료기기 소프트웨어 규제 강화에 관한 조사 결과를 발표했으며, 2025년과 2026년 내내 추가 협의를 진행하고 있으므로 그 경계선이 활발하게 재설정되고 있습니다.
ACSQHC (호주 임상 안전 및 품질 위원회) 가이드라인 또한 동의 절차, 법적·의료적 요구 사항을 충족하는 요약, AI가 관여했음을 나타내는 라벨링된 기록, 그리고 정기적인 성능 검토를 요구합니다. 라벨링과 감사 로그 (audit log)를 첫 번째 스프린트 (sprint)부터 구축하십시오. 나중에 이를 사후 적용 (retrofitting)하는 것은 매우 고통스러운 작업입니다.
호주의 도입 사례가 존재하지만 아직 초기 단계입니다. Gold Coast Hospital and Health Service는 2024년에 외래 전문 분야를 대상으로 16주간의 앰비언트 스크라이브 (ambient scribe) 시험 운영을 실시했습니다. 이 시험은 환자 및 직원 설문조사, 인터뷰, 스크라이브 (scribe) 결과물 및 전자 의무 기록 (eMR) 검토를 통해 평가되었으며, 노트 품질과 효율성 향상과 더불어 직원 및 환자 경험 측면에서 긍정적인 결과가 보고되었습니다. 이는 유용한 사례이며 외래 환자 중심의 사례입니다. 이를 문제가 해결되었다는 증거로 보지 말고, 자체적인 측정 기반의 파일럿 (pilot) 프로젝트를 실행해야 하는 근거로 삼으십시오.
한 가지 문서 유형과 한 곳의 클리닉에서 시작하십시오. 임상의가 검토한 샘플을 바탕으로 도입 전후의 누락 사항을 측정하십시오. 만약 누락되는 필드 (fields)를 줄이지 못한다면, 이를 도입할 가치가 없습니다.
PicNet은 호주 기업들을 위한 프로덕션 AI (production AI) 시스템을 구축합니다. 첫 번째 프로젝트가 어떤 모습일 수 있을지에 대해 저희에게 문의하십시오.
원문은 picnet.com.au에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기