의료 AI를 위한 신뢰성 계층: LangSmith 활용 사례
요약
본 기사는 LangSmith를 활용하여 의료 AI 시스템의 평가 및 검증 과정을 혁신하는 방법을 다룹니다. Abridge와 Included Health 같은 기업들은 LangSmith를 통해 임상 검토 데이터를 재사용 가능한 자산으로 변환하고, 이를 통해 릴리스 주기를 단축하며 안전성과 신뢰성을 높이고 있습니다.
핵심 포인트
- LangSmith는 임상 검토를 재사용 가능한 레이블 및 데이터셋으로 전환합니다.
- 전문가 검증을 반복적 비용이 아닌 인프라로 활용하는 것이 핵심입니다.
- AI 시스템의 평가 시, 정확성뿐 아니라 전체 맥락과 안전한 다음 단계를 확인해야 합니다.
- LangSmith 사용 후 채팅 참여도가 증가하고 고위험 상황 플래그 지정률이 높아졌습니다.
핵심 요약
- LangSmith는 팀이 임상 검토(clinical review)를 재사용 가능한 레이블, 평가자 및 데이터셋으로 변환하여, 매번 처음부터 시작할 필요 없이 향후 릴리스에 걸쳐 사용할 수 있게 합니다.
- Abridge는 LangSmith를 사용하여 평가를 실행함으로써, 릴리스 주기를 1~2개월에서 며칠로 단축하는 데 도움을 받았습니다.
- Included Health는 AI 건강 가이드의 라우팅 품질과 안전성을 모니터링하기 위해 LangSmith를 사용합니다. 출시 후 채팅 참여도가 75% 증가했으며, 시스템은 고위험 상황의 99% 이상을 정확하게 플래그 지정했습니다.
의료 분야에서 AI 시스템이 올바르게 작동하는지 판단하는 가장 좋은 심사위원은 그 시스템이 보호하기 위해 만들어진 사람들입니다. 임상의는 생성된 메모가 증상을 올바르게 귀속했는지 또는 환자에게 가장 적절한 수준의 치료가 권장되었는지 빠르게 파악할 수 있습니다. 그러나 이들은 무기한으로 수천 건의 만남(encounter)에 걸쳐 이러한 검토를 수행할 수는 없습니다. 대규모로 확장될 때, 전문가 검증은 한계 요인이 됩니다.
의료 팀들은 이 문제에 다양한 방식으로 접근해 왔지만, 많은 경우 하나의 원칙을 공유합니다. 즉, 임상 검토를 반복적인 운영 비용이 아닌 인프라로 취급한다는 것입니다. 본 블로그는 AI 의료 제품을 서로 다른 방식으로 구축하는 두 조직이 어떻게 평가 관행으로 수렴하는지 다룹니다. 이들은 LangSmith를 사용하여 전문가의 입력(expert input)을 레이블링된 데이터셋, 보정된 평가자(calibrated evaluators), 자동화된 릴리스 게이트와 같은 지속 가능한 자산으로 변환합니다. 목표는 인간의 판단을 제거하는 것이 아니라 그 가치를 복리화(compound)시키는 것입니다.
다음 내용을 살펴볼 수 있습니다:
- 희소한 임상 전문 지식을 어떻게 장기적인 평가로 전환할 수 있는지
- 재사용 가능한 평가가 신뢰성과 안전성을 유지하면서 더 빠른 릴리스를 가능하게 하는 방법
- 보호 건강 정보(PHI) 처리 및 드리프트와 같은 현재의 평가 과제들
.png)
의료 분야 AI 평가의 어려움
의료 AI 에이전트는 환자 치료 결정이나 방문 문서화와 같은 다양한 워크플로우 전반에 걸쳐 작동합니다.
Included Health는 LangGraph와 Deep Agents를 기반으로 하는 AI 가이드인 Dot을 구축했습니다. Dot은 모호한 회원 니즈를 해석하고, 보장 및 청구 질문에 답하며, 적절한 치료 경로로 사람들을 안내하고, 응급 상황을 감지합니다. 스캔의 보장 여부에 대한 질문이 몇 차례의 대화 끝에 사실 회원이 일차 진료 의사(primary care physician)와 상담해야 한다는 것을 밝혀낼 수 있습니다. Dot을 평가한다는 것은 정확성을 확인하는 것과 동시에, 회원의 전체 맥락(full context)을 사용하여 안전하고 적절한 다음 단계를 추천했는지 여부를 확인하는 것을 의미합니다.
Abridge는 환자와 임상의 간의 대화를 임상 기록으로 변환합니다. 환자의 동의를 얻어 의사가 진료 내용을 기록하면, Abridge가 그 대화를 하나의 노트로 변환하여 장기 건강 기록(longitudinal health record)의 일부가 되고 청구를 지원하게 합니다. 이러한 환경에서는 출처 표기(attribution)가 매우 중요합니다. 만약 환자의 관찰 내용이 의사의 결론처럼 제시된다면, 증상이 청구 가능한 진단으로 바뀔 수 있습니다. 환각(Hallucinations)은 또 다른 위험을 초래합니다. 처방된 적 없는 약물이나 용량이 기록에 들어갈 수 있기 때문입니다. 신뢰할 수 있는 노트는 누가 무엇을 말했는지 보존하고, 임상적으로 중요한 것을 포착하며, 대화가 뒷받침하지 않는 것은 아무것도 도입해서는 안 됩니다.
이러한 시스템들은 각기 다른 방식으로 실패하지만, 두 팀 모두 LangSmith를 사용하여 동일한 제약 조건에 대응합니다. 바로 정확성은 엔지니어링 팀 외부의 누군가에 의해 결정되며, 그 사람의 시간은 시스템 내에서 종종 가장 부족한 자원이라는 점입니다.
이는 전문가 검토(expert review)가 필수적임과 동시에 잠재적인 병목 현상(bottleneck)이 될 수 있음을 의미합니다. Abridge 팀이 말했듯이, “신뢰는 방울로 얻고 양동이로 잃습니다.” 목표는 각 전문가의 판단을 미래 테스트, 출시 및 반복 작업 전반에 걸쳐 재사용 가능하게 만드는 것입니다.
임상 검토가 메워야 할 격차(The gaps clinical review must close)
임상적 판단이 자동화된 평가로 인코딩되기 전에, 팀들은 먼저 전문가들이 정확히 무엇을 평가하고 있는지 정의해야 합니다. 세 가지 속성(properties)이 그 판단을 확장하기 어렵게 만듭니다.
정답(Ground truth)은 결코 단일하지 않습니다. 임상 기록에는 하나의 정형화된 형태가 없습니다*. *무엇이 포함되어야 하는지는 전문 분야, 진료 상황, 임상의에 따라 다르며, 합리적인 전문가들 사이에서도 의견 불일치가 발생할 수 있습니다. 참고 자료(Reference notes)는 유용하지만, 단일한 참고 자료를 유일한 정답으로 취급하는 것은 유효한 변이를 패널티화할 뿐만 아니라 여전히 임상적으로 중요한 오류를 놓칠 수 있습니다.
'올바른 무행동(Correct inaction)'도 중요합니다. 의료팀은 시스템이 올바르게 작동했는지, 그리고 언제 행동하지 않아야 하는지 인식했는지를 평가해야 합니다. 예를 들어, Included Health의 검토자들은 응급 안전장치(emergency guardrails)가 적절할 때 발동하는지, 그리고 무해한 경우에는 비활성 상태를 유지하는지 확인합니다. 예를 들어, Abridge는 자체 에이전트가 경계를 벗어나지 않는지, 그리고 임상의가 예상할 만한 도구를 선택하는지를 테스트합니다.
검토자의 전문 지식도 명세의 일부입니다. Abridge는 평가에 이사회 인증 의사(board-certified physician) 또는 특정 전문가가 필요한지 사전에 결정합니다. 심판은 자신을 보정(calibrate)한 판단만큼만 유용하기 때문입니다.
이 모든 것이 임상적 판단을 자동화하는 것을 불가능하게 만들지는 않습니다. 단지 책임감 있게 수행하기 위한 요구 사항, 즉 유효한 변이에 대한 허용 범위, 발생하지 않은 것에 대한 주의 깊은 관찰, 그리고 모든 레이블 뒤에 있는 적절한 전문 지식을 정의할 뿐입니다.
임상 전문 지식을 지속 가능한 아티팩트로 전환하기
팀이 보존해야 할 판단을 정의하면, 그들은 전문가 지식을 인프라로 변환하는 작업을 시작할 수 있습니다. Abridge는 임상의의 입력을 레이블링된 데이터셋과 개별 검토가 끝난 후에도 계속 작동하는 보정된 심판(calibrated judges)으로 전환합니다.
Abridge는 임상의와 사용자 피드백에서 알려진 실패 모드(failure modes)부터 시작합니다. 팀은 이를 발생 빈도와 심각성에 따라 순위를 매기고, 정확성(accuracy), 규정 준수(compliance), 스타일(style), 완전성(completeness)과 같은 범주로 그룹화하며, 각 범주에 대한 별도의 심판을 구축합니다. 평가자들이 하나의 일반적인 품질 점수를 산출하기보다는, 기록이 실패할 수 있는 구체적인 방식들을 테스트합니다.
시간 절약은 평가자들이 판단을 내린 이후에 발생하는 과정을 자동화함으로써 이루어집니다.* 이전에는 임상의가 주석 가이드(annotation guide)를 작성하고 진료 기록(encounter)에 라벨링한 다음, 누군가가 심판(judge)의 프롬프트를 수동으로 조정하여 그 점수가 해당 라벨과 일치하도록 했습니다. Abridge는 이제 동일한 가이드와 예시들을 자동화된 프롬프트 최적화 프레임워크에 공급하여 심판을 생성합니다.
어떤 단일 참고 자료도 모든 유효한 기록을 담을 수 없기 때문에, Abridge는 상호 보완적인 강점을 가진 두 가지 접근 방식을 결합합니다:
**참고 자료 비의존형 심판(Reference-free judges)**은 진료 기록을 그 출처 대화와 직접 비교하여 점수를 매깁니다. 비교할 참고 자료가 필요 없기 때문에, 이들은 진료 기록 전반에 걸쳐 일반화되며 개발 중이든 프로덕션에서 지속적으로 실행될 수 있습니다.**참고 자료 기반 심판(Reference-based judges)**은 출력을 선별된 예시들과 비교하며 의료 전문 분야에 맞게 조정할 수 있어, 광범위한 심판들이 놓칠 수 있는 맥락과 미묘한 차이를 포착합니다.
이 두 가지는 함께 폭넓음(breadth)과 정밀도(precision)의 균형을 이룹니다. 하나는 진료 기록 전반에 걸쳐 확장 가능한 커버리지를 제공하는 반면, 다른 하나는 임상 검토가 요구하는 전문 분야별 미묘한 차이를 포착합니다.
최적화된 심판이라 할지라도 여전히 임상의의 주석을 통해 검증되어야 합니다. LangSmith의 Align Evaluator는 팀에게 이 둘을 비교하고 불일치를 조사할 수 있는 인터페이스를 제공합니다. Abridge는 또한 주석 작성자들에게 출력이 정확하더라도 그 결정에 대해 설명하도록 요청합니다. 이러한 설명들은 불일치를 해결하고 라벨이 신중한 검토를 반영하는지 확인하는 데 도움이 됩니다.
그 결과는 검사, 재보정 및 재사용이 가능한 평가 시스템입니다. 개별적인 판단들을 지속 가능한 평가 도구로 변환함으로써, 팀은 희소한 임상 전문 지식을 가장 큰 가치를 더할 수 있는 사례에 보존합니다. 프로덕션 검토(Production review)는 이러한 표준을 최신 상태로 유지하는 새로운 사례와 피드백을 공급합니다.
프로덕션 검토를 통한 평가 루프 닫기
보정된 심사위원(Calibrated judges)은 팀이 이미 포착한 판단을 적용합니다. 프로덕션 검토는 그 판단의 다음 라운드를 공급하여, 시스템이 실제 대화에서 어떻게 작동하는지 밝히고 무엇을 수정해야 하는지에 대한 증거를 생성합니다.
Included Health는 이러한 새로운 증거가 루프에 들어가는 방식을 보여줍니다. 대화 내용은 LangSmith 주석 큐(annotation queue)로 들어가며, 임상 검토자들은 Dot이 회원에게 올바른 진료 환경으로 안내했는지, 응급 안전장치(emergency guardrails)가 적절하게 작동했는지, 그리고 해당 사례에 후속 조치가 필요한지 평가합니다.
그러한 결정들은 구조화된 레이블이 되어 Included Health의 데이터 웨어하우스로 내보내지고, 그곳에서 데이터 과학 팀은 이를 활용하여 운영 대시보드를 구축합니다. 또한 이 정보는 Dot이 회원을 안내하는 방식을 관리하는 스킬 정의(skill definitions)에 다시 피드백됩니다. 모든 검토는 한 번 소비되고 세 번 사용됩니다.
그 결과는 강력한 피드백 루프입니다. 임상적 판단은 데이터가 되고, 그 데이터는 제품 변경을 안내하며, 그 변경 사항들은 다음 출시 전에 동일한 표준에 대해 테스트됩니다. 모든 검토는 당면한 사례와 시스템의 미래 행동 모두에 기여합니다.
평가를 릴리스 게이트로 전환하기
이 피드백 루프는 릴리스 시점에 결실을 맺습니다. 팀들은 모든 후보 변경 사항을 처음부터 평가하는 대신, 이미 포착한 증거를 기반으로 테스트할 수 있습니다.
Abridge의 경우, 모델 변경은 점진적으로 더 현실적인 단계를 거칩니다: 오프라인 평가(offline evaluations), 과거 만남 기록에 대한 백테스팅(backtesting), 제한된 A/B 테스트, 전체 출시, 그리고 지속적인 프로덕션 모니터링입니다. 각 단계는 다른 종류의 증거를 추가합니다.

A/B 테스트는 이 과정에서 가장 특이한 단계입니다. Abridge의 일부 파트너들은 사일런트(silent) 출시에 포함되는 최초의 10~15% 고객 중 하나가 되기로 동의합니다. 이를 통해 Abridge는 자동화된 평가 도구가 제공할 수 없는 신호, 즉 임상의들이 생성된 기록을 수정하는지 여부, 그들이 얼마나 높은 점수를 주는지, 그리고 어떤 질적 피드백을 공유하는지를 관찰할 수 있습니다. 오프라인 평가는 변경 사항이 제한적인 노출에 적합한지 확립하며, 프로덕션(production) 동작은 출시가 확장되어야 하는지를 결정합니다. 이 프로세스를 통해 Abridge는 릴리스 주기를 한두 달에서 단 며칠로 단축했습니다.
Included Health 역시 동일한 원칙을 아키텍처 변경에 적용했습니다. Dot의 슈퍼그래프(supergraph)를 Deep Agents로 이전하는 작업은 네 개의 제품 팀에 영향을 미쳤고, 이들 모두는 변경 사항으로 인한 문제를 일으킬까 봐 경계했습니다. 해당 팀은 기존의 다중 턴 시뮬레이션 스위트(multi-turn simulation suite)를 실행하여 성능이 유지됨을 확인했고, 심각한 회귀 없이 2주도 안 되어 마이그레이션을 완료했습니다.
두 경우 모두, 출시 신뢰도가 누적되었습니다. 팀들은 매번 변화가 있을 때마다 신뢰를 재구축하는 대신, 이미 수집했던 증거를 바탕으로 구축할 수 있었습니다.
프로덕션에서 신뢰성 측정하기
빠른 릴리스 주기는 시스템이 실제 사용자에게 도달했을 때 안정적으로 작동한다면 의미가 있습니다. Included Health는 세 가지 차원, 즉 채택률(adoption), 라우팅 품질(routing quality), 그리고 안전성(safety)에 걸쳐 성능을 측정합니다.
각 지표는 다른 질문에 답합니다: 회원들이 제품을 사용할까요? 적절한 치료로 안내할까요? 긴급한 주의가 필요한 상황을 인식할까요? 이들을 함께 살펴보면 팀에게 더 완전한 프로덕션 신뢰성 그림을 제공합니다.
Dot 출시 이후, Included Health는 채팅 참여도(chat engagement)에서 75%의 증가를 보고했습니다. 등급이 매겨진 대화 중 Dot의 치료 권고에 대한 임상의들의 동의율은 팀 목표인 95% 이상을 유지하고 있으며, 임상 감사 결과 Dot가 99% 이상의 고위험 상황을 식별하는 것으로 나타났습니다.
Abridge의 경우, 레이블링된 에이넘터(encounter)는 향후 출시 버전을 대상으로 테스트하는 심사위원들을 보정합니다. Included Health의 경우, 임상 라벨은 그것을 생성한 대화보다 더 오래 지속됩니다. 이러한 아티팩트들(artifacts)은 여전히 검토와 재보정이 필요하지만, 그 뒤에 있는 전문가 판단은 더 이상 단일 결정에 의해 소모되지 않습니다.

평가 파이프라인 내의 PHI (Protected Health Information)
임상적 판단을 재사용 가능하게 만드는 아티팩트들—에이넘터 추적(encounter traces), 대화 기록(conversation histories), 임상의 주석(clinician annotations)—은 보호 건강 정보(PHI)를 포함할 수도 있습니다. 팀들이 이러한 데이터를 저장하고 재사용하기 시작하면, 보안 및 배포 아키텍처가 평가 설계의 일부가 됩니다.
Abridge는 자체 호스팅(self-hosting), 접근 제어(access controls), 감사 가능성(auditability)을 평가 인프라의 필수 요구사항으로 간주합니다. 또한 학습에 사용하기 전에 대화 데이터에서 식별 가능한 정보를 제거합니다. 이것들은 평가 파이프라인 구축 후에 추가할 통제가 아니라, 애초에 어떤 데이터가 이 파이프라인에 들어올 수 있는지를 결정하는 요소입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 LangChain Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기