Included Health가 LangGraph와 Deep Agents를 활용하여 구축한 연합형 헬스케어 에이전트
요약
Included Health가 LangGraph와 Deep Agents를 활용하여 구축한 헬스케어 플랫폼 'Dot'은 기존의 경직된 의사 결정 트리 방식에서 벗어나, 복잡하고 개인화된 의료 여정을 지원하는 연합형 멀티 에이전트 아키텍처를 제시합니다. 이 시스템은 사용자의 맥락과 필요에 맞춰 적응하며, 단순한 정보 제공을 넘어 실질적인 헬스케어 내비게이션 역할을 수행합니다.
핵심 포인트
- LangGraph와 Deep Agents로 연합형 멀티 에이전트 아키텍처 구축
- 기존의 경직된 의사 결정 트리 방식의 한계 극복
- 사용자의 맥락과 필요에 맞는 개인화된 헬스케어 경험 제공
Included Health는 고용주 및 건강 보험사와 제휴하여 직원과 가입자에게 원격 진료(virtual primary care), 행동 건강, 응급 치료, 전문 치료 등 다양한 서비스에 대한 헬스케어 내비게이션을 제공하는 올인원 헬스케어 플랫폼입니다. 이 제품 경험은 Deep Agents와 LangGraph를 사용한 연합형 멀티 에이전트 아키텍처 위에 구축된 AI 기반 헬스케어 가이드인 Dot을 통해 의료적, 재정적 또는 행정적 질문에 답변하는 데 중점을 두고 있습니다.
과제: 헬스케어 내비게이션은 의사 결정 트리(decision tree)에 맞지 않는다
헬스케어는 사람이 요청하는 것과 실제로 필요한 것이 완전히 다를 수 있는 몇 안 되는 영역 중 하나입니다. "동맥 플라크 검사가 제 보험으로 보장되나요?"라고 묻는 가입자가 몇 가지 후속 질문을 통해 고콜레스테롤혈증 관리를 하고 있으며 심장병 가족력이 있다는 사실을 알게 될 수도 있습니다. 올바른 답변에는 금액이 포함되어야 하지만, 일차 진료 의사와의 대화를 장려할 기회를 인식하는 것을 의미할 수도 있습니다.
역사적으로 헬스 시스템은 이러한 종류의 라우팅(routing)을 구조화된 내비게이션 트리로 처리해 왔습니다. 이 접근 방식은 복잡한 요구 사항을 소프트웨어에서 관리 가능하게 만들었지만, 오직 미리 정의된 결정들의 연속으로 평탄화함으로써만 가능했습니다. 엔지니어링 매니저인 Kartik Darapuneni가 설명했듯이: "가입자 입장에서는 매우 경직되어 느껴지고, 좋은 경험이 아닙니다." 이러한 한계는 대화가 "가슴 통증을 느끼고 있습니다."로 시작될 때 더욱 심각한 결과를 초래합니다. 시스템은 일곱 번의 명확히 하는 질문 후에가 아니라 첫 번째 차례에 잠재적인 응급 상황임을 인식해야 합니다.
이것이 수십 년 동안 소프트웨어를 형성해 온 광범위한 트레이드오프(tradeoff)입니다. 확장하기 위해 기술은 일반적으로 복잡한 인간의 상황을 평균 사례를 중심으로 표준화해야 했습니다. 맥락이 단순히 올바른 답변과 도움이 되는 답변 사이의 차이를 만드는 헬스케어 분야에서는, 그 트레이드오프가 특히 비용이 많이 듭니다.
LLM은 에이전트 하네스(agent harness)와 결합하여 가능한 것의 범위를 변화시킵니다. LLM은 밀집된 개별 건강 기록을 처리하고, 모호한 필요에 대해 추론하며, 구성원들을 미리 정해진 경로로 강제하지 않고 명확히 하는 질문을 할 수 있습니다. Kartik은 “LLM이 이 세 가지 장애물(blocker)을 한 번에 해결했습니다”라고 말했습니다. 대화는 더욱 자연스러워지고, 소프트웨어는 더 이상 개인화와 규모 확장성 사이에서 선택할 필요가 없습니다. Included Health는 각 구성원의 맥락에 맞춰 적응하는 헬스케어 경험을 구축하여, 그 상황이 요구하는 긴급성, 안내, 그리고 다음 단계를 제시합니다.
에이전트 아키텍처: Deep Agents를 활용한 연합형 슈퍼그래프
Included Health의 프로덕션 아키텍처는 Dot이라는 메인 LangGraph 그래프를 중심으로 합니다. 이 안에서 Dot은 거래적 상호작용(예: 보장 범위 질문 처리, 청구 문의)을 위한 주요 대화 라우터 역할을 하며, 올바른 진료 지점으로의 내비게이션 역할도 수행합니다. 일련의 서브 워크플로우는 응급 진료 접수, 예약 일정 관리, 전문의 찾기, 행동 건강 등 도메인별 구성원 여정을 처리합니다.
Included Health의 다양한 제품 팀들이 이 그래프의 각 부분을 소유하고 있습니다. 예를 들어, 예약 일정 관리만 하더라도 구성원이 어떤 서비스에 자격이 되는지, 그들의 보장 세부 정보, 주 구성원인지 부양가족인지 여부, 그리고 광범위한 임상적 미묘함(clinical nuances)까지 고려해야 합니다.
Included Health는 Deep Agents를 추가하여 해당 서비스 전반에 걸쳐 일관성을 유지했습니다. Staff Machine Learning Engineer인 Rohan Bhandari는 "원래에는 다른 에이전트로 넘어가면 갑자기 내용이 훨씬 짧고 무뚝뚝해졌습니다. 목소리나 톤이 같지 않았죠"라고 말했습니다. Deep Agents를 사용하면서 팀은 모든 에이전트가 개별적으로 관리할 필요 없이, 목소리와 톤을 위한 글로벌 플랫폼 프롬프트를 만들 수 있었습니다. 한 워크플로우에서 다른 워크플로우로 라우팅될 때, Deep Agent의 파일 시스템과 내장된 컨텍스트 관리는 나가는 에이전트가 대화를 요약하고, 이 요약과 전체 대화 기록에 대한 파일 경로를 받는 에이전트에게 모두 전달할 수 있게 합니다. 이러한 설정은 구성원이 서로 다른 팀이 소유한 여러 에이전트를 거치면서 같은 내용을 반복해야 하는 일이 없도록 보장합니다.
예를 들어, 공유 보장 질문 기능(shared coverage question skill)을 생각해 봅시다. 보장 관련 질문은 대화 시작 시에 반드시 발생하는 것은 아닙니다. 구성원이 전문의를 찾는 도중에 그것이 얼마의 비용이 들지 알고 싶어 할 수도 있습니다. Deep Agents 이전에는 이를 처리하려면 모든 서브 워크플로우의 라우팅 로직에 걸쳐 보장 기능을 연결해야 했습니다. 이제는 Rohan이 "이를 모든 Deep Agent가 상속받을 수 있는 플랫폼 서브 에이전트로 분해했습니다. 즉, 모든 에이전트가 보장 질문에 답할 수 있게 된 것입니다"라고 말했습니다.
LangGraph는 일관된 구성과 분산 개발을 가능하게 하여 각 제품 팀이 자신들의 서비스를 독립적으로 구축하고 소유할 수 있도록 합니다. Deep Agents는 고객 대화가 여러 서비스 전반으로 이동함에 따라 톤과 행동을 일관되게 유지하는 공유 파일 시스템을 추가합니다.
역량 레지스트리로서의 스킬(Skills as a capability registry)
Included Health는 Deep Agent 스킬을 사용하여 에이전트에게 임상적 역량과 서비스를 제공합니다. 각 스킬은 해당 서비스가 무엇인지, 언제 적절한지, 언제 부적절한지, 그리고 엣지 케이스(edge cases)를 어떻게 처리해야 하는지를 설명합니다. 예를 들어, 부양 가족이 자격 요건의 미묘함(eligibility nuances)이 있는 서비스를 예약하려고 할 때 무엇을 해야 하는지와 같은 경우입니다.
모델은 멤버를 안내하는 적절한 대화를 유도하기 위해 점진적 공개(progressive disclosure) 방식을 사용합니다. 예를 들어, 멤버가 의사 진료를 받고 싶다고 말할 경우, 도움을 줄 수 있는 3가지 이상의 적절한 방법이 있을 수 있습니다 (예: 가상 응급 진료, 가상 일차 진료, 직접 방문 가능한 의사 찾기). 에이전트는 가상 파일 시스템을 통해 관리되는 스킬 레지스트리(skill registry)를 가지고 있으며, 처음에는 각 스킬에 대한 짧은 설명을 받습니다. 호출 시 모델은 어떤 스킬이 관련성이 있는지 결정하고, 이후 전체 스킬 파일을 로드할 수 있습니다. 이 스킬 파일들을 통해 멤버를 가장 잘 안내하기 위해 필요한 미묘한 차이점과 질문을 학습합니다 (예: 가상 방문을 원하는지 직접 방문을 원하는지? 설명하는 문제가 급성인지 아니면 장기적인 제공자 관계를 통해 더 잘 관리될 수 있는지?).
Included Health는 자체 서비스 외에도 제3자 고용주 혜택(third-party employer benefits)을 지원하며, 각 고용주 플랜의 20~30개 혜택까지 포함하도록 이를 스킬로 인코딩하는 작업을 진행하고 있습니다.
“저희에게는 채팅을 검토하고 저희가 멤버를 보낸 치료 지점(care spot)에 동의하는지 확인하는 임상팀이 있습니다.”라고 Rohan이 덧붙였습니다. 이러한 피드백 루프 덕분에 Included Health는 시간이 지남에 따라 스킬 정의를 조정하여 임상 라우팅 합의율 95%라는 목표 수준을 유지할 수 있었습니다.
인간 개입(human handoff)을 핵심 설계 제약 조건으로 만들기, 예외 상황이 아닌 것으로 다루기
Included Health의 에이전트 시스템에서 두드러지는 측면은 환자 경험 개선을 위해 인간 참여(human-in-the-loop)를 통합한 방식입니다. Kartik은 “저희는 LangGraph를 전체 메시징 플랫폼으로 생각합니다”라고 말했습니다. LangGraph의 내구성 있는 실행(durable execution) 기능은 에이전트가 대화 전반에 걸쳐 완전한 컨텍스트를 유지할 수 있게 하여, 무기한 일시 중지 및 컨텍스트 보존을 지원합니다. 에이전트가 불확실성에 도달하면 그래프를 일시 중단하고, 인간 멤버 케어 옹호자(human member care advocate)에게 다중 차례 교환(multi-turn exchange)을 위해 라우팅한 다음 재개하며—이때 에이전트는 인간이 무엇을 했고 말했는지에 대한 전체 컨텍스트를 보유합니다.
이러한 설계는 헬스케어 관계가 가진 지속적인 특성을 반영합니다. 회원은 며칠 또는 몇 주 후에 동일한 대화 스레드로 돌아와 후속 질문을 할 수 있으며, 에이전트는 인간의 도움을 받은 부분에 대한 전체 컨텍스트를 포함하여 중단했던 지점부터 다시 시작할 수 있습니다. 카르틱(Kartik)은 “인간의 관점에서 보면, 그들은 모든 작업을 수행하는 것이 아니라 에이전트가 막히지 않도록 돕는 것입니다”라고 말했습니다.
또한 이 아키텍처는 다음 진화를 위한 여지를 남겨둡니다. 즉, 인간이 대화를 처리하는 동안 병렬 에이전트 스레드를 실행하여, 에이전트가 배경 조사를 수행하고 케어 애드보케이트에게 실시간으로 추천 사항을 제시할 수 있도록 하는 것입니다.
LangSmith를 활용한 관측 가능성 및 지속적 개선
LangSmith 주석(annotation) 큐는 Included Health가 임상 감독을 운영하는 핵심입니다. 현재 모든 대화는 임상팀 검토를 위해 큐에 들어갑니다. 검토자들은 에이전트의 탐색 추천이 정확했는지, 비상 가드레일(emergency guardrails)이 적절하게 작동했는지(또는 적절하게 작동하지 않았는지), 그리고 후속 조치가 필요한 모든 것을 평가합니다. 이 레이블들은 LangSmith에서 Included Health의 데이터 웨어하우스로 내보내지며, 이곳에서 데이터 사이언스 팀은 운영 지표 대시보드를 구축합니다.
LangChain의 사용자 시뮬레이션 패키지를 사용한 다중 턴(Multi-turn) 사용자 시뮬레이션 평가(evals)는 아키텍처 변경을 위한 안전망이 되었습니다. 표준 에이전트에서 Deep Agents로 슈퍼그래프 전반에 걸친 마이그레이션은 네 개의 제품 팀에 영향을 미쳤고, 이들 모두가 변경 사항으로 인한 오류 발생을 경계했습니다. 로한(Rohan)은 “우리는 전체 평가 스위트를 실행하여 대부분 더 나은 성능을 얻었음을 확인했고, 그 후에 다른 팀들에게 이를 공유할 자신감을 가질 수 있었습니다”라고 말했습니다. 이러한 평가 덕분에 마이그레이션은 2주도 안 되는 기간에 이루어졌으며, 심각한 회귀(regressions)나 팀의 저항 없이 진행되었습니다.
결과
Dot은 지난 몇 년간 로한이 “가장 순조로운 출시”라고 묘사한 가운데 클라이언트들에게 출시되었고, 초기 지표들은 세 가지 영역에 걸쳐 올바른 방향으로 추이를 보이고 있습니다.
참여도 (Engagement): 멤버들이 에이전트와 훨씬 높은 비율로 상호작용하여 채팅 참여도가 75% 증가했습니다.임상 정확성 (Clinical accuracy): 임상의들은 Dot의 치료 권고가 자신이 평가한 대화에서 목표치인 95%를 크게 초과하여 적절하다고 동의했습니다. Included Health의 임상팀은 LangSmith 주석(annotation) 큐를 통해 대화를 라벨링하며, Dot이 멤버에게 올바른 진료를 안내했는지 판단합니다.임상 안전성 (Clinical safety): Dot은 정기적인 임상 감사(clinical audits)를 통해 검증된 바와 같이 높은 위험 상황의 99% 이상을 식별합니다. 이러한 높은 탐지율 덕분에 팀은 취약한 멤버들에게 가능한 한 빨리 선제적으로 개입하고 지원할 수 있습니다. Deep Agents를 활용하여 프로덕션급 에이전트 시스템 구축에 관심 있으신가요? Deep Agents에 대해 더 알아보기.
AI 자동 생성 콘텐츠
본 콘텐츠는 LangChain Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기