신뢰할 수 있는 의료용 AI는 불확실성을 매끄러운 임상 기록 뒤에 숨기는 대신 가시화한다
요약
의료용 AI 서기 시스템에서 발생하는 '그럴듯한 오류'의 위험성을 경고하며, AI의 불확실성을 숨기지 않고 워크플로 내에서 가시화해야 한다고 강조합니다. 시스템이 모호한 정보를 확신하는 것처럼 출력하는 대신, 검토자가 즉시 인지하고 수정할 수 있도록 플래그를 표시하는 설계가 필요합니다.
핵심 포인트
- 그럴듯해 보이는 AI의 오류는 발견하기 어렵고 위험함
- 불확실성을 숨기지 말고 워크플로의 일부로 가시화해야 함
- AI에게 자가 검증을 맡기기보다 고정된 규칙 기반 검증 필요
- 증거가 불충분한 경우 확신 대신 플래그 표시를 권장
의사가 상담 중에 특정 약물을 언급합니다. AI는 임상 기록(clinical note)에 다른 약물 이름을 작성합니다.
그것은 여전히 실제 존재하는 약물입니다. 철자도 올바르게 보입니다. 기록의 형식도 잘 갖춰져 있습니다. 명백하게 잘못된 부분은 아무것도 보이지 않습니다.
바로 그 점이 실수를 위험하게 만듭니다.
사람들이 AI의 오류에 대해 이야기할 때, 종종 터무니없는 상황을 상상하곤 합니다. 지어낸 진단명, 의미 없는 텍스트, 또는 눈에 띄게 틀린 답변 같은 것들 말이죠. 그러한 실패는 찾아내기 쉽습니다. 더 까다로운 실패는 너무나 그럴듯해서, 아무도 의문을 제기하며 멈추지 않고 정상적인 워크플로 (workflow)를 그대로 통과해 버립니다.
의료 기록에서 "맞아 보인다"는 것만으로는 충분하지 않습니다.
유용한 기록이 자동으로 신뢰할 수 있는 기록이 되는 것은 아니다
의료용 AI 서기 (Medical AI scribes)는 임상의들에게 엄청난 시간을 절약해 줄 수 있습니다. 이들은 녹음된 상담 내용을 구조화된 기록으로 변환하여, 임상의가 모든 것을 처음부터 직접 타이핑할 필요가 없게 만듭니다.
하지만 시스템은 구어 (spoken language)를 바탕으로 작동합니다. 사람들은 빠르게 말하고, 약어를 사용하며, 서로의 말을 끊고, 발음이 비슷한 단어들을 언급합니다. AI는 약물을 오해하거나, 두 사실 사이의 연결을 약하게 만들거나, 대화 내용이 뒷받침하는 것보다 더 확신에 찬 어조로 기록 필드를 작성할 수 있습니다.
문제는 AI가 기록 작성을 도와서는 안 된다는 것이 아닙니다. 문제는 시스템이 불확실할 때 어떤 일이 벌어지는가 하는 점입니다.
만약 불확실성이 숨겨진 채로 남아 있다면, 임상의는 수용할 준비가 된 것처럼 보이는 매끄러운 답변을 받게 됩니다. 만약 불확실성이 가시화된다면, 임상의는 중요한 결정을 내릴 수 있습니다.
그것이 제가 의료용 AI 서기 작업을 하며 가졌던 안전 목표였습니다. 즉, 그럴듯한 실수가 조용히 기록의 일부가 되도록 방치하지 않으면서도 시스템을 유용하게 만드는 것입니다.
불확실성을 가시화하라
페이지 하단에 표시되는 경고는 충분하지 않습니다. 특히 출력물의 나머지 부분이 깔끔해 보일 때는 놓치기가 너무 쉽습니다.
대신, 시스템이 인식하는 모든 약물은 명확한 상태를 보여주어야 합니다. 여기에는 정확히 일치하는 것처럼 보이는 약물 이름도 포함됩니다. 올바르게 보이는 이름이라 할지라도 문맥상 오해되었을 가능성이 여전히 있기 때문입니다.
검토자는 어떤 용어에 주의가 필요한지 즉시 확인할 수 있으며, 제안된 수정 사항을 선택하거나 직접 올바른 이름을 입력할 수 있습니다. 시스템은 검토자에게 모호한 경고를 조사하라고 요구하지 않습니다. 대신 명확한 결정 사항과 그에 따라 즉시 조치할 수 있는 빠른 방법을 제공합니다.
중요한 변화는 간단합니다. 불확실성이 성공적인 것처럼 보이는 기록 뒤에 숨겨지는 것이 아니라, 워크플로 (workflow)의 일부가 된다는 점입니다.
AI가 스스로의 숙제를 채점하게 두지 마세요
AI에게 자신의 답변이 맞는지 물어보고 싶은 유혹이 생길 수 있습니다. 그렇게 하면 더 나은 추측을 내놓을 수는 있겠지만, 신뢰할 수 있는 검증 (check)을 만들어내지는 못합니다.
기록의 중요한 부분에 대해서는 시스템에 고정된 규칙이 필요합니다. 즉, 동일한 증거를 보았을 때 매번 동일한 답을 내놓는 검증 절차가 필요합니다.
예를 들어:
- 약물 이름이 신뢰할 수 있는 의학 용어와 일치하는가?
- 노트 필드가 실제로 대화에서 추출된 사실에 의해 뒷받침되는가?
- 이 필드를 사실로 표시할 만큼 충분한 증거가 있는가, 아니면 인간의 검토를 위해 표시해야 하는가?
시스템이 특정 값을 뒷받침할 수 없다면, 확신을 가지고 작성해서는 안 됩니다. 값을 비워두거나 검토를 위해 명확하게 플래그 (flag)를 표시해야 합니다.
AI는 여전히 자신이 잘하는 일, 즉 경청하고, 정보를 정리하며, 초안을 제안하는 일을 할 수 있습니다. 하지만 자신의 불확실한 출력을 기록에 입력해도 될 만큼 충분히 안전하다고 스스로 결정하게 해서는 안 됩니다.
수정 또한 안전해야 합니다
안전은 거대한 AI의 결정에만 존재하는 것이 아닙니다. 그 주변의 작은 동작들 속에도 존재합니다.
약물을 수정하는 임상의 (clinician)가 실수로 노트의 다른 텍스트를 변경해서는 안 됩니다. 빈 확인 사항이 이미 존재하던 값을 덮어써서도 안 됩니다. 검토 단계에서는 변경 사항이 저장되기 전에 어떤 일이 일어날지 명확하게 보여주어야 합니다.
이러한 세부 사항들은 사소하게 들릴 수 있습니다. 하지만 그렇지 않습니다.
의료 기록은 결정의 사슬입니다. AI가 무엇을 들었는지, 무엇을 제안했는지, 시스템이 무엇을 검증했는지, 임상의가 무엇을 검토했는지, 그리고 최종적으로 무엇이 저장되었는지에 대한 사슬입니다. 그 사슬의 어느 곳에서든 발생하는 작은 불안전한 단계 하나가 나머지 전체의 신뢰성을 무너뜨릴 수 있습니다.
훌륭한 안전 작업은 종종 새로운 AI 기능보다 눈에 덜 띕니다. 그것은 검증 (validation), 명확한 상태 표시, 합리적인 기본값 (defaults), 그리고 세심하게 테스트된 엣지 케이스 (edge cases)입니다. 하지만 바로 이러한 요소들이 유용한 도구가 조용히 신뢰할 수 없게 변하는 것을 막아줍니다.
인간의 검토 (Human review)는 의미가 있어야 합니다
"인간 참여형 (Human in the loop)"은 말하기 쉬운 문구입니다. 하지만 인간이 시스템이 틀릴 수 있는 지점을 진정으로 파악할 수 있고, 마찰 없이 이를 수정할 수 있을 때에만 의미가 있습니다.
진정한 검토 단계는 세 가지 질문에 답할 수 있어야 합니다:
- 무엇이 불확실한가?
- 왜 불확실한가?
- 이에 대해 내가 무엇을 할 수 있는가?
만약 답변이 단지 "이것을 확인해 주세요"뿐이라면, 검토자는 도움 없이 추가적인 작업만을 요구받는 것입니다. 만약 시스템이 정확한 약물이나 노트 필드를 지목하고, 그 상태를 설명하며, 안전한 수정 경로를 제공한다면, 검토는 의미 있는 통제 (control)가 됩니다.
임상의는 AI에 단순히 승인 도장을 찍기 위해 그 자리에 있는 것이 아닙니다. 인터페이스는 중요한 순간에 임상의가 AI의 의견에 반할 수 있도록 도와야 합니다.
이것이 해결하지 못하는 것
이러한 점검들이 AI 시스템을 의학적으로 무결하게 만들어주지는 않습니다. 시스템은 모든 대화에서 의사가 진정으로 의도했던 바가 무엇인지 결정할 수 없습니다. 또한 임상적 판단 (clinical judgement)을 대체하지도 않습니다.
이것이 할 수 있는 일은 더 정직한 것입니다. 즉, 시스템이 확신에 찬 언어 뒤에 불확실성을 숨기는 것을 막는 것입니다.
증거가 강력할 때, 시스템은 빠르게 도움을 줄 수 있습니다. 증거가 약할 때, 시스템은 이를 명시해야 합니다. 그리고 결정에 임상의가 필요할 때, 워크플로우 (workflow)는 그 결정이 가시적이고 수행하기 쉽게 만들어야 합니다.
그것이 바로 실제 운영 환경 (production)에서 신뢰할 수 있는 AI의 모습입니다.
결코 실수를 하지 않는 AI가 아니라, 불확실성을 무시할 수 없게 만드는 시스템입니다.
저는 Mohamed Azahrioui이며, 운영 환경의 AI 시스템을 위한 결정론적이고 감사 가능한 (auditable) 통제 장치를 구축하는 백엔드 및 AI 안전 (AI-safety) 개발자입니다.
이 글은 소프트웨어 공학에 관한 기사이며, 의학적 조언이 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기