AI 지원 의료 코딩: 코더들이 방어할 수 있는 제안
요약
의료 코딩 분야에서 AI를 활용할 때 완전 자동화 대신 '제안 엔진(suggestion engine)' 형태의 아키텍처를 구축해야 함을 강조합니다. 인력 부족 문제를 해결하기 위해 AI가 코더에게 실시간 피드백을 제공하여 정확도를 높이는 방안을 제시합니다.
핵심 포인트
- 완전 자동 코딩 대신 코더를 지원하는 제안 엔진 구축 권장
- 의료 코딩 인력 부족 및 고령화 문제 해결을 위한 AI 도입 필요성
- 현재 LLM의 의료 코드 생성 정확도 및 환각(Hallucination) 문제 지적
- 정확한 DRG 및 NWAU 보고를 위한 실시간 피드백 아키텍처 중요성
임상 코딩(Clinical coding)은 소프트웨어 오류가 직접적으로 계산 가능한 달러 가치를 갖는 병원 내 몇 안 되는 분야 중 하나입니다. 활동 기반 자금 지원(Activity based funding, ABF) 체제 하에서, 2025-26년 국가 효율 가격(National Efficient Price)은 NWAU당 $7,258(25)로, 이는 5.9% 증가한 수치이며 국가 ABF가 시작된 이후 가장 큰 폭의 상승입니다. 편도 절제술은 0.7421 NWAU로 약 $5,386입니다. 경증 복잡도의 고관절 치환술은 4.0251 NWAU로 약 $29,214입니다. 복잡도 수준을 변화시키는 추가 진단을 놓치면, 단 한 번의 에피소드에서 다섯 자리 숫자의 차이가 발생하게 됩니다.
이것이 바로 우리가 보건 의료 CIO(Chief Information Officers)들과 AI가 실제로 비용을 회수할 수 있는 지점에 대해 이야기할 때 코딩 문제가 계속해서 언급되는 이유이며, 우리가 계속해서 동일한 답변을 드리는 이유입니다: 코딩 엔진(coding engine)이 아닌 제안 엔진(suggestion engine)을 구축하십시오. 이 포스트는 우리의 Practical AI in Health 시리즈의 일부이며, 코딩 팀 앞에 배치할 아키텍처, 증거가 뒷받침하는 내용, 그리고 비용에 대해 다룹니다.
문제는 역량이 아니라 규모입니다
퇴직 인원은 2018년 1,130만 명에서 2022년 1,210만 명으로 약 7% 증가한 반면, 코더 인력은 고령화되고 있으며 대학들은 보건 정보 관리(Health Information Management, HIM) 프로그램을 폐쇄하고 있습니다. 이전에 제공되던 학부 HIM 과정의 절반이 등록률 저조로 인해 중단되었으며, AIHW는 이를 코딩 인력 부족에 대한 분석에서 지적했습니다. 빅토리아주의 Northern Health는 바로 이러한 이유로 기존의 레거시 코딩 시스템에서 벗어났습니다. 해당 기관의 보건 정보 서비스 디렉터인 Odette Taylor는 AI 구성 요소가 퇴직 인원이 증가함에 따라 코딩 인력을 확충해야 할 필요성을 줄여주며, 코더에게 실시간 피드백을 제공하여 정확한 DRG(Diagnosis Related Group) 및 NWAU 보고를 지원한다고 말했습니다.
따라서 수요는 실재합니다. 질문은 모델에게 무엇을 안전하게 맡길 수 있느냐 하는 것입니다.
왜 오늘날 완전 자동 코딩은 방어 불가능한가
여기서 가장 강력한 단일 인용 문구는 Soroush 등이 수행한 NEJM AI 벤치마크로, GPT-3.5, GPT-4, Gemini Pro 및 Llama2-70b를 대상으로 ICD-9-CM, ICD-10-CM 및 CPT 코드를 생성하는 능력을 테스트했습니다. GPT-4가 그중 가장 우수했으나, ICD-10-CM에 대해 단 33.9%의 정확한 일치(exact match)율만을 기록했습니다. 또한 모델들은 유효해 보이지만 청구할 수 없는(non-billable) 코드를 생성하거나, 단순히 조작된(fabricated) 코드를 만들어내기도 했습니다. 이는 제공된 설명으로부터 코드를 찾아내는(lookup) 작업이었으며, 이는 퇴원 요약지(discharge summary)에서 코드를 추상화(abstracting)하는 것보다 훨씬 쉬운 작업입니다.
여기에 호주의 복잡한 상황을 더해 보겠습니다. 이곳의 입원 에피소드는 2025년 7월 1일부터 적용되는 ICD-10-AM/ACHI/ACS 제13판에 따라 코딩되며, 그 상위에는 AR-DRG V12.0이 위치합니다. AR-DRG V12.0은 11,057개의 범위 내 ICD-10-AM 코드에 걸쳐 진단 복잡도 수준(Diagnosis Complexity Levels)을 할당합니다. 미국의 임상 수정판(American clinical modification)으로 학습된 범용 모델은 해당 분류 체계를 알지 못하며, 판본은 3년 주기로 변경됩니다. 무엇을 구축하든 모델이 학습 과정에서 흡수한 내용이 아니라, 퇴원(separation) 날짜에 효력이 있는 판본에 맞춰 버전을 관리해야 합니다.
보조적 구성(assisted configuration)은 이야기가 다릅니다. npj Digital Medicine에 발표된 10명의 공인 코딩 전문가를 대상으로 한 13주간의 무작위 대조 시험(randomised controlled trial)에 따르면, AI 지원 워크플로우는 정확도를 유지하면서 코딩 시간을 유의미하게 단축하는 것으로 나타났습니다. 만족도는 코더의 숙련도와 자격증 보유 여부에 따라 달랐는데, 이는 생각보다 훨씬 중요한 문제입니다. 시니어 코더들이 신뢰하지 않는 도구는 결국 우회하여 사용될 것이기 때문입니다.
HIMAA의 AI 생성 임상 코딩 데이터에 대한 국가 가이드라인도 같은 입장을 취하며, 7가지 고려 사항 중 인간의 전문 지식과 인간 참여형(human-in-the-loop) 방식을 포함하고 있습니다. 또한 호주 맥락에서 이점이 있다는 발표된 증거가 여전히 부족하다는 점을 솔직하게 언급하고 있습니다. 아직 이곳에서 이를 증명한 사람은 아무도 없습니다. 이에 따라 설계하십시오.
아키텍처 (The architecture)
우리가 구축할 패턴은 다음과 같습니다:
- EMR 및 PAS로부터 HL7 v2 또는 FHIR를 통해 유입되는 문서: 퇴원 요약지(discharge summary), 수술 보고서(operation reports), 경과 기록(progress notes), 병리 결과(pathology). 이를 신뢰할 수 있고 반복적으로 흐르게 만드는 것은 일반적인 통합 작업이며, 이것이 바로 우리가 Centazio를 구축한 목적입니다.
- 각 에디션별로 라이선스를 받은 IHACPA 코드 목록으로부터 구축된 코드 인덱스. 각 에디션별로 별도로 보관되며, 분리 날짜(separation date)에 따라 어떤 인덱스를 조회할지 결정됩니다.
- 검색 우선, 생성 후순위(Retrieval first, generation second). 모델은 코드를 자유롭게 생성하지 않습니다. 모델은 검색된 집합에서 후보를 지명하며, 해당 에디션의 인덱스에 존재하지 않는 모든 것은 인간에게 전달되기 전에 폐기됩니다.
- 호주 코딩 표준(Australian Coding Standards) 체크를 적용하는 규칙 레이어(rules layer): 주진단 순서 지정(principal diagnosis sequencing), 추가 진단 기준(additional diagnosis criteria), 필수 ACHI 쌍(mandatory ACHI pairings).
- 코더용 패널: 제안된 각 코드와 해당 코드가 추출된 정확한 텍스트 범위를 함께 보여주어, 검토 시 기록 전체를 다시 읽는 대신 두 문장만 읽으면 되도록 합니다.
- 추가 전용 감사 로그(append-only audit log): 코더가 확인하기 전에 먼저 기록됩니다.
감사 기록(audit record)은 사람들이 건너뛰었다가 나중에 후회하는 부분입니다. 대략 다음과 같은 형태여야 합니다:
{
"episode_id": "",
"separation_date": "2026-03-14",
...
해당 로그는 두 가지를 제공합니다. 외부적으로는 자격을 갖춘 사람이 모든 코드를 할당했으며, 도구는 결정(decided)한 것이 아니라 제안(suggested)했다는 점을 입증합니다. 내부적으로는 품질 피드백 루프 (quality feedback loop) 역할을 합니다. 코딩 오류는 무작위가 아니라 체계적입니다. 2개 주에 걸친 55개 병원의 6,300개 기록을 대상으로 한 외부 감사 결과, 5.9%의 예측 DRG 불일치율이 발견되었습니다. 한 병원에서는 5.6%의 불일치가 여전히 거의 800만 달러의 자금 부족으로 이어졌는데, 이는 가치가 높은 DRG에서의 단 하나의 오류가 여러 번 반복되었기 때문입니다. 코드, 코더(coder), DRG별로 정리된 로그는 이러한 반복을 드러내지만, 집계된 정확도를 보여주는 스프레드시트는 그렇지 못합니다.
규제 및 개인정보 보호 입장
코더 대상 제안 도구는 일반적으로 Exclusion 14G에 따라 TGA 의료 기기 규제 범위 밖에 위치합니다. 이 조항은 재무 기록, 청구 및 빌링을 포함한 보건 프로세스의 관리 또는 운영을 위한 소프트웨어를 다룹니다. 해당 제외 조항은 모든 기능이 기준을 충족하고 도구가 임상적 의사결정 (clinical decision-making)에 영향을 미치지 않을 때만 유효합니다. 누군가가 에피소드(episode) 중에 제안 내용을 치료 임상의에게 표시하도록 요청하는 순간, 의도된 목적이 변경된 것이므로 분류를 재검토해야 합니다.
거버넌스 (Governance)는 2025년 8월에 발표된 ACSQHC의 AI 임상 사용 가이드를 따를 수 있으며, 이 가이드는 사용 전, 사용 중, 사용 후를 중심으로 구조화되어 있습니다. 이 세 단계는 증거 검토, 모니터링을 동반한 코더 교육, 그리고 각 분류 버전 변경 후의 정기적인 재평가와 명확하게 매칭됩니다.
개인정보 보호(Privacy)는 이사회에 보고되어야 할 부분입니다. 이러한 시스템은 전체 퇴원 요약지(discharge summaries), 수술 보고서(operation reports), 경과 기록(progress notes)을 입력값으로 사용합니다. 보건 의료 서비스 제공업체는 OAIC의 2025년 통지 대상 데이터 유출 통계에서 알림의 19% (1,205건 중 225건)를 차지하며 가장 많이 침해된 부문이었습니다. 추론(inference)이 호주 내 인프라에서 실행될지, 누가 인덱스(index)를 쿼리할 수 있는지, 그리고 요청 페이로드(request payloads)를 얼마나 오래 보관할지를 조기에 결정하십시오. 이러한 답변은 나중에 변경하기가 더 어렵습니다.
솔직한 비용 문제
IHACPA 분류 제품 라이선스 비용, 에디션 변경 시 3년마다 수행하는 재인덱싱(re-index) 및 재검증(re-validation) 비용, 그리고 에피소드(episodes) 수가 아닌 문서량에 따라 확장되는 추론(inference) 비용을 예산에 반영하십시오. 가장 큰 비용은 모델이 아닙니다. 자체 분리 데이터로부터 감사인이 검토한 이상적인 골드 코딩 평가 세트(gold-coded evaluation set)를 구성하는 비용과, 적절한 전후 측정을 수행하기 위한 코더의 작업 시간입니다. 이 세트가 없다면 도구가 도움이 되고 있는지, 아니면 팀원들에게 그럴듯하게 틀린 코드(plausible wrong codes)를 수용하도록 조용히 가르치고 있는지 알 수 없습니다. 이는 우리가 가장 우려하는 실패 모드(failure mode)입니다.
단일 고용량 전문 분야에서 시작하여, 매칭된 기준선(baseline) 대비 에피소드당 소요 시간과 사후 감사 불일치율(post-audit mismatch rate)을 측정하고, 코더를 코드를 할당하는 주체로 유지하십시오. 해당 구성이 증거가 뒷받침하는 방식입니다.
PicNet은 호주 조직을 위한 프로덕션 AI 시스템을 구축합니다. 첫 번째 프로젝트가 어떤 모습일지에 대해 저희에게 문의하십시오.
원문은 picnet.com.au에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기