주제를 파악하기 위한 환자 피드백 및 불만 사항 마이닝 (Mining)
요약
의료 기관의 방대한 환자 자유 형식 텍스트 데이터를 AI를 활용해 주제 마이닝하는 방법을 제안합니다. 이는 비용 효율적이며 임상적 위험이 낮은 AI 프로젝트의 시작점으로 적합합니다.
핵심 포인트
- 기존 설문 데이터의 자유 형식 텍스트를 활용한 주제 마이닝 가능
- 폐쇄형 문항이 놓치는 잠재적 케어 요소를 토픽 모델링으로 발견
- 의사소통 문제 등 민감한 불만 사항의 사전 신호 포착 가능
- 임상적 결정과 분리된 저위험 AI 프로젝트로서의 가치
호주의 대부분의 의료 서비스 기관들은 아무도 처음부터 끝까지 읽지 않은 수년간의 환자 의견들을 쌓아두고 있습니다. 리커트 척도 (Likert scores) 점수들은 표로 정리되어 분기별 보고서에 포함됩니다. 자유 형식의 텍스트 (free text)는 해당 보고서를 작성하는 담당자에 의해 대략적으로 훑어본 뒤, 나머지는 아카이브(archive)됩니다. 이 포스트는 우리의 Practical AI in Health 시리즈의 일부이며, 만약 여러분이 비용이 저렴하고, 이사회에 가시적이며, 임상적 결정과는 거리가 먼 첫 번째 AI 프로젝트를 찾고 있다면, 우리가 보통 사람들에게 추천하는 것이 바로 이것입니다.
데이터는 이미 그곳에 있습니다
만약 여러분이 호주의 병원을 운영하고 있다면, 아마 이미 자유 형식의 의견 필드가 포함된 ACSQHC의 12개 항목 환자 경험 질문 세트인 AHPEQS를 수집하고 있을 것입니다. 한 실행 연구에서는 18개월 동안 36개 사립 병원에서 실시된 86,180건의 설문조사를 다루었습니다. 주제 마이닝 (theme-mining) 프로젝트를 위해 새로운 것을 수집할 필요는 없습니다. 코퍼스 (corpus)는 이미 존재합니다.
범위를 설정하기 전에 데이터의 양을 파악하는 것이 중요합니다. 한 지방 의료 시스템의 입원 환자 설문 분석에 따르면, 성인 환자의 43.4%와 소아 보호자의 46.9%가 자유 형식의 의견을 남겼으며, 해당 의견들에 대한 토픽 모델링 (topic modelling) 결과, 기존 설문 문항에서는 묻지 않았던 케어 요소들을 포함하여 86개의 성인 주제와 35개의 소아 주제가 도출되었습니다. 마지막 부분이 바로 이 작업을 수행해야 하는 근거입니다. 폐쇄형 문항 (Closed items)은 누군가가 질문하겠다고 생각한 것만을 측정할 수 있기 때문입니다.
한 병원의 2023년 피드백 코퍼스에는 126,134개의 항목이 있었으며, 그중 92,578개가 자유 형식의 텍스트였고, 총 토큰 (tokens) 수는 약 157만 개, 의견당 평균 단어 수는 16.9개였습니다. 짧은 의견들이 대량으로 존재하는 형태입니다. 기계가 처리하기에는 사소한 수준이지만, 사람이 읽기에는 비현실적인 양입니다.
불만 사항 (Complaints)은 별도의 스트림이며 더욱 민감한 영역입니다. Ahpra는 2024/25년에 전년 대비 19% 증가한 13,327건의 의료 종사자 관련 통지(notifications)를 접수했으며, 이 중 임상 진료 (clinical care)가 전체 통지의 35%를 차지했고, 의사소통 (communication) 문제가 4,313건으로 두 번째로 큰 이슈였습니다. 의사소통 문제는 공식적인 경로로 나타나기 몇 달 전부터 자유 형식의 텍스트 (free text)에서 나타나는 전형적인 신호입니다.
이것이 저위험 시작점인 이유
연방 정부의 보건 의료 분야의 안전하고 책임 있는 AI 입법 및 규제 검토 (Safe and Responsible AI in Health Care legislation and regulation review) 결과에 따르면, 의견 수렴 대상자들은 현재의 규제 시스템이 목적에 부합하지 않는다고 판단했으며, 고위험 환경 (high-risk settings)을 위한 의무적인 가드레일 (guardrails)을 조사했습니다. 환자들이 대기 시간이나 주차에 대해 작성한 내용을 분석하는 것은 고위험 환경이 아닙니다. 여기에는 진단 (diagnosis), 분류 (triage), 치료 권고 (treatment recommendation), 그리고 환자에게 직접 전달되는 출력물 (patient-facing output)이 포함되지 않습니다.
또한, 이는 이미 충족해야 하는 인증 (accreditation) 요건과도 맞닿아 있습니다. NSQHS Action 1.13은 정기적으로 환자 및 보호자의 피드백을 구하고 이를 안전 및 품질 개선에 사용할 것을 요구하며, 관련 Action 1.14는 개선을 추진하기 위해 불만 사항 분석 결과를 관리 기구에 보고하고, 식별된 위험을 위험 관리 시스템 (risk management system)에 기록할 것을 요구합니다. 주제 마이닝 (theme-mining) 프로젝트는 이 모든 것에 대한 증거를 부산물로 생성합니다.
토픽 모델 (topic model)이 아닌 분류 체계 (taxonomy)로 시작하세요
유혹적인 접근 방식은 비지도 클러스터링 (unsupervised clustering)을 실행하여 무엇이 결과로 나오는지 살펴보는 것입니다. 그것은 두 번째로 하세요. Healthcare Complaints Analysis Tool (Gillespie and Reader, BMJ Qual Saf 2016)부터 시작하십시오. 이 도구는 88,069건의 불만 사항을 다루는 59개 연구의 체계적 문헌 고찰 (systematic review)을 바탕으로 구축되었으며, 729개의 코드를 세 가지 영역과 일곱 가지 문제 범주(품질, 안전, 환경, 기관 프로세스, 경청, 의사소통, 존중 및 환자 권리)로 정제했습니다. 각 항목은 네 가지 심각도 수준과 더불어 치료 단계 및 위해 (harm) 여부에 따라 등급이 매겨집니다.
두 가지 실질적인 결과가 있습니다. 첫째, 평가자들은 불만 편지 한 통당 평균 1.94개의 문제를 발견했으므로, 귀하의 분류기 (classifier)는 멀티 레이블 (multi-label) 방식이어야 합니다. 단일 레이블 (single-label) 분류는 신호의 절반을 조용히 놓치게 될 것입니다. 둘째, 이미 발표된 분류 체계 (taxonomy)를 사용한다는 것은 귀하의 수치를 다른 사이트나 다른 연도와 비교할 수 있음을 의미하며, 임의로 만들어낸 클러스터 집합으로는 불가능한 일입니다.
귀하가 구축하려는 것과 가장 유사하게 발표된 사례는 2025년의 단면 연구 (cross-sectional study)입니다. 이 연구에서는 7개 공공 1차 의료 클리닉의 익명 불만 사항 1,816건이 훈련된 인간에 의해 HCAT(GP)에 따라 코딩된 후, GPT-3.5 turbo, GPT-4o mini 및 Claude 3.5 Sonnet에 의해 분류되었습니다. 정확도는 분야에 따라 58.4%에서 95.5% 사이였으며, 인간 코더와의 일치도 (Cohen's kappa)는 0.114에서 0.623까지 크게 차이가 났고, 저자들은 추가적인 미세 조정 (fine-tuning)이 필요하다고 결론지었습니다. 동일한 코퍼스 (corpus)에 대한 주제 분석 (thematic analysis) 결과, 긴 대기 시간 (21.6%), 직원의 태도 (15.8%), 예약 문제 (10.5%)가 전체 불만 사항의 거의 절반을 차지했습니다. 이 결과를 다음과 같이 해석하십시오: 읽기 순서를 우선순위화하기에는 충분히 좋지만, 검토 없이 그대로 출판하기에는 충분하지 않습니다.
아키텍처 (The architecture)
- 설문 플랫폼, 불만 사항 등록부(complaints register), 피드백 수신함으로부터 스테이징 저장소(staging store)로 데이터를 수집(Ingest)합니다. 우리는 이러한 다중 소스 통합(multi-source integration) 작업을 위해 Centazio를 구축했지만, 불변의 스테이징 복사본(immutable staging copy)을 제공하는 파이프라인이라면 무엇이든 괜찮습니다.
- 데이터가 네트워크를 벗어나기 전에 비식별화(De-identify)를 수행합니다. 환자 이름, 의료진 이름, 날짜, 병실 및 병동 식별자를 제거하거나 가명 처리(pseudonymise)하고, 매핑 정보는 내부 환경에 보관합니다.
- 각 코멘트를 HCAT 레이블에 따라 구조화된 출력(structured output), 다중 레이블(multi-label) 방식으로 분류하며, 이때 신뢰도 값(confidence value)과 모델이 참조한 텍스트 범위(text span)를 함께 제공합니다.
- 분류 체계(taxonomy)가 제대로 처리하지 못하는 코멘트들에 대해 2차 작업으로 비지도 클러스터링(unsupervised clustering)을 실행합니다. 바로 여기서 아무도 질문할 생각을 못 했던 카테고리들이 나타납니다.
- 사이트, 병동, 분기별로 테마 수치를 집계하며, 감성 트렌드 라인(sentiment trend lines)과 특정 테마의 비중이 역사적 범위(historical band)를 벗어날 때 발생하는 간단한 알림 기능을 포함합니다.
- 신뢰도가 낮거나 심각도가 높은 항목은 인간 검토 대기열(human review queue)로 라우팅합니다.
코멘트별 출력 결과는 다음과 같은 형태입니다:
{
"comment_id": "c-2026-04-118322",
"domain": "management",
...
여기서 인간의 승인(Human sign-off)은 주의 사항이 아니라 설계 요구 사항(design requirement)입니다. 품질 관리자(quality officer)가 분류를 확인하지 않은 항목은 리스크 등록부(risk register), 특정 개인, 또는 관리 기구 보고서에 도달할 수 없습니다. 모델은 무엇을 먼저 읽을지 결정하고, 사람은 그것이 무엇을 의미하는지를 결정합니다.
개인정보 보호 및 거버넌스 (Privacy and governance)
2024년 10월에 발표된 OAIC의 개인정보 보호 및 상용 AI 제품 사용에 관한 지침(guidance on privacy and the use of commercially available AI products)이 기준이 되는 문서입니다. 개인정보가 AI 시스템을 훈련, 테스트 또는 실행하는 데 사용되는 모든 곳에 1988년 개인정보 보호법(Privacy Act 1988)과 APP(Australian Privacy Principles)가 적용됩니다. AI 맥락에서는 APP 10의 정확성 의무(accuracy obligations)가 더욱 강화되며, OAIC는 새로운 시스템을 도입하기 전에 개인정보 영향 평가(Privacy Impact Assessment, PIA)를 실시하고 자발적 AI 안전 표준(Voluntary AI Safety Standard)에 맞출 것을 권장합니다. 데이터셋 간의 교차 매칭을 통한 재식별(Re-identification)이 주요 위험으로 지목되었는데, 이는 환자들이 단 두 문장의 의견만으로도 임상의, 병동, 날짜를 일상적으로 언급하기 때문에 매우 중요한 문제입니다.
첫날부터 이를 위한 예산을 편성하십시오. NIHR의 공동 설계(co-design) 연구는 실시간에 가까운 대시보드를 갖춘 자동화된 자유 형식 텍스트 분석(automated free-text analysis)을 입증했으나, 이후 계획된 NHS 전역의 확산은 기술적 실패가 아닌 정보 거버넌스(information governance) 문제로 인해 중단되었습니다. 이 프로젝트 역시 이곳에서 프로젝트가 중단될 가능성이 가장 높은 방식입니다.
비용 및 현실적인 한계 (Costs and honest limits)
모델 비용은 가장 작은 항목입니다. 현재의 API 가격을 기준으로 할 때, 프롬프트(prompt)를 튜닝하면서 여러 번 다시 실행하더라도 100만 또는 200만 토큰의 코퍼스(corpus)를 분류하는 데 드는 비용은 매우 적습니다. 진짜 비용은 인적 자원입니다. 검증 세트(validation set)를 구축하기 위해 두 명의 직원이 수백 개의 댓글을 이중 코딩(double-coded)하는 데 드는 품질 관리자(quality officer)의 2~3주간의 시간, 그리고 PIA와 벤더 검토(vendor review) 비용이 핵심입니다.
미리 언급해 둘 만한 몇 가지 한계점이 있습니다. 17단어 정도의 짧은 댓글에 대한 감성 분석 (Sentiment)은 노이즈가 많으므로, 개별 댓글에 대한 점수가 아닌 하나의 추세 (trend)로 읽어야 합니다. 피드백 양은 강한 의견 쪽으로 치우치는 경향이 있으므로, 테마 (theme) 빈도가 환자 인구 집단의 발생률 (incidence rates)을 의미하는 것은 아닙니다. 심각도 분류 (Severity classification)는 모델 간의 일치도가 가장 낮은 부분이므로, 오직 분류 보조 도구로만 취급하십시오. 그리고 모델 버전을 변경한다면 과거 이력을 다시 실행 (re-run)해야 합니다. 그렇지 않으면 귀하의 추세선은 병원이 아닌 모델을 측정하게 됩니다.
제대로 수행된다면, 최종적으로 귀하는 환자들이 실제로 말한 내용을 양과 심각도에 따라 순위를 매기고, 개별 댓글로 추적 가능하며, 인증 (accreditation) 관련 논의에서 방어 가능한 분기별 관점을 얻게 됩니다.
PicNet은 호주 기업들을 위한 프로덕션 AI 시스템을 구축합니다. 첫 번째 프로젝트가 어떤 모습일지 저희에게 문의해 주세요.
원문은 picnet.com.au에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기