헬스케어 및 생명과학 분야 에이전트 확장: Madrigal Pharmaceuticals, Abridge, Vizient의 교훈
요약
본 기사는 헬스케어 및 생명과학 분야에서 에이전트 프로그램 구축의 특성과 잠재력을 다룹니다. Madrigal, Abridge, Vizient 등의 사례를 통해 이 산업은 높은 신뢰성, 규정 준수(compliance), 환자 안전 요구사항을 충족해야 하므로 일반적인 AI 개발과 다른 인프라 계층이 필요함을 강조합니다.
핵심 포인트
- 헬스케어 에이전트는 단순한 기능 구현을 넘어 감사 및 규제 준수가 핵심입니다.
- Madrigal, Abridge, Vizient 등 선도 기업들이 실제 구축 사례를 제시했습니다.
- 에이전트의 자율성 증대 전, 추적(tracing), 평가(evals), 지출 가시성이 필수 요구사항입니다.
- 중앙 집중식 '공유 계층'을 통해 분산된 에이전트를 통합하는 패턴이 나타나고 있습니다.
헬스케어 및 생명과학 분야의 에이전트 프로그램은 대부분의 산업에서와는 다른 제약 조건 하에 구축되고 있습니다. 이러한 제약 조건들이 해결된다면 엄청난 잠재력이 있습니다. 성공한다는 것은 수 시간에 걸친 수동 검토를 몇 분으로 압축하고, 12개 시스템에 분산된 데이터를 마침내 한 곳에서 조회할 수 있게 하며, 임상의들에게 문서 작업 시간을 돌려주는 것을 의미합니다. 동시에, 잘못된 답변의 비용은 거의 모든 곳보다 높을 수 있으며, 이는 팀이 구축하는 방식을 변화시킵니다.
지불자(payers), 제공자(providers), 바이오 제약사(biopharma) 전반에 걸쳐, 에이전트를 확장하는 데 필요한 신뢰 수준을 얻는 것이 훨씬 어렵다는 것을 알 수 있습니다. 이 산업에서 신뢰는 제품 품질을 넘어 감사 요구 사항(audit requirement)이자 규정 준수 의무(compliance obligation)이며, 경우에 따라서는 환자 안전 요구 사항(patient-safety requirement)이기도 합니다. 이러한 기준을 충족하려면 많은 팀들이 첫 번째 파일럿 단계에서는 구축하지 않았을 수 있는 인프라 계층(infrastructure layer)이 필요합니다.
본 글에서는 세 개의 조직이 에이전트를 어떻게 구축하고 있는지 살펴봅니다:
Madrigal Pharmaceuticals는 직원이 구조화된 시스템, 문서 및 외부 소스 전반에 걸쳐 증거를 검색, 분석 및 종합하는 데 도움을 주는 엔터프라이즈 멀티-에이전트 플랫폼을 구축했습니다. Abridge는 임상의-환자 대화를 임상 문서로 변환하고 임상 워크플로우 전반에 걸쳐 지속적인 에이전트를 지원하는 AI를 구축합니다. Vizient는 헬스케어 제공자가 사일로화된 병원 데이터를 조회하여 외래 투자(ambulatory investments)가 효과가 있는지 또는 어디에서 더 비용 효율적으로 치료를 제공할 수 있는지와 같은 질문에 답할 수 있게 하는 GenAI 플랫폼을 구축했습니다.
이 세 곳 외에도, 우리는 헬스케어 및 생명과학 에이전트 프로그램 전반에 걸쳐 나타나는 패턴들을 활용할 것입니다.
헬스케어 및 생명과학 에이전트 프로그램에서 나타나는 새로운 패턴들
관측 가능성(Observability), 평가(evals), 그리고 비용 통제는 에이전트의 자율성을 높이는 데 필수 조건이 되고 있습니다. 이것이 저희가 듣는 가장 흔한 주제입니다. 저희가 만난 헬스케어 및 생명과학 조직 중 76%가 에이전트에게 더 많은 자율성이 부여되기 전에 추적(tracing), 평가, 지출 가시성(spend visibility)을 요구사항으로 언급합니다. 규제 환경에서는 필요성이 디버깅을 넘어 증거까지 확장됩니다. 팀들은 에이전트가 무엇을 했는지, 누가 검토했는지, 그리고 품질이 어떻게 측정되었는지에 대한 지속적인 기록이 필요한데, 이는 결국 컴플라이언스(compliance) 부서에서 요구할 기록이기 때문입니다.
건강 보험사 및 의료 제공자들의 경우, 저희가 만난 조직 중 43%는 PHI 처리, 비식별화(de-identification), 그리고 HIPAA 요구사항에 초점을 맞추고 있습니다. 또한 여러 팀들은 에이전트의 자율성을 더 확장하기 전에 사용자 및 모델 전반에 걸친 지출을 통합적으로 파악하기 위해 자체 모델 앞에 LLM 게이트웨이를 배치하고 있습니다.
중앙 집중식 에이전트 플랫폼들이 기업 전체에 분산된 에이전트들을 통합하고 있습니다. 저희가 만난 조직 중 49%는 회사 전체의 에이전트 플랫폼, 제어 평면(control plane), 또는 '에이전트 공장(agent factory)'을 주요 사용 사례로 구축하고 있으며, 비즈니스 단위 에이전트들이 그 위에 구동됩니다. 이러한 패턴은 제약사, 지불자(payers), 그리고 건강 시스템 전반에서 나타납니다. 수많은 팀들이 각자 자신만의 에이전트를 만들고, 동일한 기반을 재창조하며, 결국 한 팀에게 공유 계층(shared layer)을 소유하도록 요청받게 됩니다.
공유 계층은 재사용 가능한 템플릿 라이브러리, 내부 에이전트 카탈로그, 또는 프로토타입에서 프로덕션으로 이어지는 단일 거버넌스 경로의 형태를 취할 수 있습니다. 상위 5개 제약사 중 한 곳은 수백 개의 애플리케이션을 단일한 상호 운용 플랫폼으로 통합하고 있습니다. 최근에 만난 지불자 중 한 곳은 단일 프로덕션 에이전트에서 통일된 기반 위로 약 100개의 에이전트를 계획하는 수준까지 발전했습니다. 많은 조직들에게 있어, 명확한 프로덕션 경로가 없는 수백 개의 개념 증명(proofs of concept)들이 종종 시작점이 됩니다.
규제 문서 및 백오피스 업무에서 가장 명확한 ROI를 확인하고 있습니다. 저희가 만난 조직 중 33%는 이미 종이 기록(paper trail)과 케이스당 알려진 비용이 있는 워크플로우를 위한 에이전트를 구축하고 있습니다. 여기에는 다음이 포함됩니다:- 임상 연구 보고서 및 규제 제출 자료- FDA 서신 추출**- 의료 법률 검토**- GxP 문서 생성**- 프로토콜 OCR**- 사전 승인(Prior authorization)- 청구 수정 및 급여 조정(coordination of benefits)- 구매 주문서 및 송장 수집(ingestion)이러한 사용 사례들은 명확한 '이전과 이후' 측정 지표를 가지고 있으며, 이미 여러 에이전트가 프로덕션 환경에서 운영되고 있습니다. 의료 작가나 처리 팀에게 몇 시간이 걸릴 수 있는 작업이 이제는 분 단위로 측정될 수 있게 되었고, 심지어 파일링 일정 자체가 리더십이 추적할 수 있는 지표가 되고 있습니다.
환자 및 회원 대상 대화형 에이전트는 파일럿 단계에서 프로덕션 단계로 진입하고 있으며, 음성(voice) 기능도 포함됩니다. 저희가 만난 조직 중 26%는 회원 안내, 환자 접수 및 분류(triage)를 위해 SMS와 WhatsApp을 통한 외부 노출 에이전트를 운영하거나 구축하고 있습니다. 또한 소비자 기기 비서 및 콜센터 우회(deflection)에도 활용되고 있습니다. 음성은 이러한 프로그램의 의미 있는 부분이 되었으며, 팀들은 감정(sentiment), 이상 사례 언급(adverse-event mentions), 개인 식별 정보(PII) 노출 등을 추적하고 점수화하고 있습니다. 안전성 평가는 이 사용 사례와 밀접하게 연결되어 있습니다. 예를 들어, 정신 건강 제공자들은 배포를 확장하기 전에 경로를 벗어난 대화나 자살 사고 감지 여부를 명시적으로 테스트하고 있습니다.**
중앙 엔지니어링이 병목 현상이 될 때 분산 구축(Federated building) 이니셔티브가 자주 발생합니다. 조직의 26%는 비엔지니어들이 중앙 가드레일 내에서 에이전트를 구축하도록 시도하고 있습니다. 저희는 비즈니스 팀들이 SharePoint, EHR 요약 정보 또는 Snowflake와 같은 내부 소스를 대상으로 에이전트를 구성하고 검증하는 동시에, 중앙 팀은 가치가 입증되는 것들을 산업화(industrialize)하는 사례를 보고 있습니다.
또한 전문 지식을 가진 전문가(subject-matter experts)들이 프롬프트와 평가 데이터셋을 직접 소유하기 시작하는 것도 목격하고 있습니다. 임상의나 약사들은 개발 단계에서 프롬프트를 수정하고 평가를 실행할 수 있으며, 엔지니어링 팀은 통과한 버전을 홍보합니다.
과학 연구 및 개발(Scientific R&D) 에이전트는 구동 시간이 더 깁니다. 과학 연구 및 개발 조직들은 타겟 발굴(target discovery), 구조 기반 설계(structure-based design), 오믹스(omics) 및 단일 세포 교란 분석(single-cell perturbation analysis), 문헌 및 지식 그래프 검색(literature and knowledge-graph retrieval), 실험실 장비 제어 등을 포함하는 발견 및 실험 과학을 위한 에이전트를 만들고 있습니다.
이들 역시 업계에서 구동 시간이 가장 길고 결정론적이지 않은 에이전트 중 일부입니다. 결과적으로, 이 팀들은 단순히 최종 답변만을 판단하기보다는 에이전트가 거치는 전체 궤적(full trajectory)을 평가하는 데 특히 높은 요구 사항을 두고 있습니다.
임상의 및 치료팀 지원 사용 사례는 제공자(providers)와 지불자(payers) 사이에서 만연합니다. 많은 조직들이 방문 전 준비, 치료 경로 안내 오케스트레이션(care-navigation orchestration), 차트 준비, 의뢰 관리 등을 포함하여 임상의나 치료 관리자와 함께 작동하는 에이전트를 구축하고 있습니다. 이러한 워크플로우에서는 일반적으로 인간 개입(Human-in-the-loop)이 가정됩니다. 더 큰 장애물은 EHR 통합과 감사 의무입니다.
아래 세 조직은 회사가 첫 번째 파일럿 단계를 넘어선 후 에이전트를 운영하는 데 필요한 것을 보여줍니다.
프로덕션 환경에서 에이전트를 구축하는 세 팀
Madrigal Pharmaceuticals: 하나의 플랫폼에 많은 기능
가장 큰 제약 사항은 모든 데이터 소스가 서로 다르게 작동한다는 점이었습니다. 형식(format), 접근 패턴(access patterns), 기대치(expectations)가 모두 달랐습니다. Madrigal은 이러한 소스들을 동일한 보안 데이터 웨어하우스로 정규화(normalized)하고, 단일하며 일관된 도구 인터페이스를 통해 노출했습니다. 에이전트의 관점에서 볼 때, 모든 정보는 동일한 추상화(abstraction)를 통해 이용 가능해졌고, 시스템은 매번 오케스트레이션 로직을 재작성할 필요 없이 새로운 도메인에 추가될 수 있었습니다.
이러한 추상화 덕분에 팀은 하나의 워크플로우를 더 광범위한 플랫폼으로 전환하는 데 성공했습니다. LangChain의 Deep Agents로 구축된 오케스트레이터(orchestrator)는 작업을 받아 어떤 기능(capabilities)이 필요한지, 어떤 에이전트가 실행되어야 하는지, 그리고 결과가 통합되기 전에 어떤 작업이 병렬로 수행될 수 있는지 결정합니다. 이 오케스트레이터의 역할은 모든 도메인의 세부 사항을 인코딩하기보다는 문제를 전문화된 기능들(specialized capabilities)에 걸쳐 라우팅하는 것입니다.
새로운 사용 사례는 특정 유형의 문제에 접근하는 방법과 좋은 결과물이 무엇인지 정의하는 모듈식 스킬(modular skills)로 추가됩니다. 이러한 스킬을 활용하는 방식은 새로운 사용 사례 개발 기간을 몇 주에서 몇 시간으로 단축시켰습니다.
병렬 처리(Parallelism)는 시스템이 더 복잡한 연구를 효율적으로 처리하도록 돕습니다. 하나의 연구 질문은 하위 에이전트들(sub-agents)에 걸쳐 분할될 수 있으며, 각 하위 에이전트는 문제의 다른 부분을 담당하고, 이 하위 에이전트들은 자신들의 작업 또한 추가로 병렬화할 수 있습니다. Deep Agents 하니스에 내장된 공유 가상 파일 시스템(shared virtual filesystem)은 시스템의 메모리 역할을 합니다. 결과물, 소스, 중간 단계는 기록되어 재사용 가능하게 만들고, 시스템 규모가 커질 때 조정(coordination)을 단순화합니다.
.png)
관측성(observability) 측면에서 Madrigal은 LangSmith에 의존하여 모든 도구 호출(tool call), 검색된 청크(retrieved chunk), 에이전트 결정에 대한 전체 파이프라인 가시성을 확보했습니다.
[IMG:1)
Madrigal의 AI 및 데이터 과학 글로벌 책임자인 Parth Patel이 말했듯이, LangSmith 이전에는 팀이 시스템의 자극-반응(stimulus-response) 행동을 관찰할 수는 있었지만 내부에서 무슨 일이 일어나는지에 대한 가시성은 거의 없었습니다. 이후에는 마치 “기초 심리학에서 신경 영상학으로 넘어간” 듯한 느낌이 들었습니다.
팀은 실제 최종 사용자 피드백을 반영하도록 설계된 LLM-as-judge 채점기를 사용하여 전체 에이전트 실행에 대한 트레이스 수준 평가(trace-level evals)를 시작했습니다. 가장 지속적인 개선 중 하나는 운영 실패 사례(production failures)를 LangSmith 데이터셋에 직접 공급한 것입니다. 의미 있는 모든 오류가 새로운 테스트 케이스로 사용되어, 평가 스위트가 합성 예제에만 의존하는 것이 아니라 실제 실패로부터 성장할 수 있게 했습니다.
배포 역시 소규모 팀이 모든 인프라 구성 요소를 처음부터 구축하기 어려웠던 영역 중 하나였습니다. Madrigal은 LangSmith Deployment를 사용하여 그래프를 관리형 서비스로 배포했으며, 여기에는 상태 지속성(state persistence), 동시 세션(concurrent sessions), UI로의 실시간 스트리밍, 그리고 스킬 업데이트를 자동으로 전송하는 CI/CD 파이프라인이 포함되었습니다. Madrigal CIO인 Ron Filippo에 따르면, 프로토타입에서 엔터프라이즈 사용으로 전환하는 데 팀이 예산 책정했던 몇 달 대신 몇 주밖에 걸리지 않았습니다.

주요 교훈:
- 데이터 계층을 추상화(Abstracting the data layer)함으로써 Madrigal은 매번 오케스트레이션(orchestration)을 재구축할 필요 없이 새로운 도메인을 추가할 수 있었습니다.
- 모듈식 스킬(Modular skills)은 단일 사용 사례를 플랫폼으로 전환시켰고, 새로운 요구 사항이 생길 때마다 동일한 시스템 내의 새로운 스킬이 되었습니다.
- 운영 트레이스(production traces)와 평가 스위트 간에 루프를 닫는 것(Closing the loop) 또한 플랫폼이 시간이 지남에 따라 실제 실패로부터 개선될 수 있도록 했습니다.
더 알아보기: Madrigal 사용자 스토리 (블로그)
Abridge: 임상의의 신뢰를 측정 가능한 평가 시스템으로 전환하기
Abridge는 임상의가 환자 대화 내용을 임상 문서로 전환하는 데 도움을 주는 AI를 구축합니다. 미국에서는 매년 20억 건 이상의 임상의-환자 대화가 이루어집니다. 환자의 동의하에, 임상의가 방문 기록을 남기면 Abridge는 이를 전자의무기록(EHR)에 제출할 수 있는 임상적으로 유용한 노트로 변환합니다. 목표는 임상의들이 그렇지 않으면 퇴근 후 문서 작업을 끝내는 데 사용해야 했을 '잠옷 시간'을 되찾아 주는 것입니다.

Abridge는 현재 50개 이상의 전문 분야와 28개 언어에 걸쳐 250개 이상의 의료 시스템 파트너와 협력하며, 연간 1억 건 이상의 대화를 기록하고 있습니다.

이 회사는 거의 모든 제품 결정에 영향을 미치는 제약 조건 하에서 운영됩니다. 이해관계가 임상적이기 때문에 출시할 수 있는 기준(bar)은 극도로 높습니다. 잘못 귀속된 진단, 환각된 약물 정보, 또는 부정확한 용량은 실제 환자 안전 문제로 이어질 수 있습니다. 이러한 동일한 기준은 제품이 구축되고 배포되는 방식에도 적용되며, HIPAA, PHI 처리, 그리고 엔터프라이즈 신뢰가 처음부터 아키텍처를 형성합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 LangChain Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기