생명과학 분야를 위한 에이전트 하네스 구축: Deep Life Sci 소개
요약
Deep Life Sci는 생명과학 분야의 R&D 비용 증가 문제를 해결하기 위해 개발된 오픈 소스 에이전트형 어시스턴트입니다. 이 시스템은 수천만 건의 과학 논문과 임상 데이터를 활용하며, 안전한 샌드박스 환경에서 데이터 분석을 수행하고 여러 서브 에이전트에 작업을 위임합니다. 이를 통해 기업들이 자체 지능을 소유하고 커스터마이징할 수 있게 합니다.
핵심 포인트
- 생명과학 R&D 비용은 지속적으로 증가하는 추세입니다.
- Deep Life Sci는 임상/실험실 과학자를 위한 전문 오픈 소스 에이전트입니다.
- PubMed, ClinicalTrials.gov 등 방대한 생명과학 데이터에 접근합니다.
- LangSmith 샌드박스를 통해 안전한 코드 기반 데이터 분석을 지원합니다.
핵심 요약
제약 R&D 비용은 지난 수십 년 동안 폭증했습니다. 에이전트는 이러한 추세를 역전시킬 잠재력을 가지고 있지만, 일반 AI 도구는 생명과학 분야가 실제로 필요로 하는 도메인 지식과 데이터 통합 기능을 갖추고 있지 못합니다. 저희는 임상 및 실험실 과학자를 위한 오픈 소스 에이전트형 어시스턴트인 Deep Life Sci를 구축했습니다. 이는 수천만 건의 과학 논문에서 직접 정보를 가져오고, 안전한 샌드박스 환경에서 데이터 분석을 수행하며, 수백 개의 서브 에이전트에게 작업을 위임합니다. Deep Life Sci는 지능형 시스템을 소유하는 것을 간단하게 만듭니다. R&D 팀은 자체 데이터를 추가하고 컨텍스트를 제공할 수 있으며, LangSmith 추적(tracing)과 평가(evals)를 사용하여 실제로 무엇이 작동하고 있는지 확인할 수 있습니다.
Eroom의 법칙(힌트: Eroom을 거꾸로 읽어보세요)은 무어의 법칙의 악몽 같은 쌍둥이입니다. 지난 70년간 컴퓨팅 파워 가격이 기하급수적으로 하락하면서 개인용 컴퓨터, 인터넷, 휴대폰 그리고 이제 AI 혁명을 가져왔습니다. 하지만 제약 연구는 불행하게도 정반대의 방향으로 진행되어 왔으며, 신약을 개발하는 비용은 매 9년마다 두 배씩 증가하고 있습니다.
AI 에이전트는 이러한 추세를 역전시킬 잠재력을 가지고 있지만, 일반 목적의 솔루션들은 생명과학 조직이 필요로 하는 도메인 특수성을 갖추고 만들어지지 않았습니다. 이것이 바로 저희가 임상 및 실험실 과학자를 위해 특별히 만든 오픈 소스 에이전트형 어시스턴트 Deep Life Sci를 개발한 이유입니다.

제약 연구 개발의 가속화되는 비용
많은 AI 기업들은 자신들의 도구가 연구 생산성 회복에 도움을 줄 것이라고 약속하지만, Claude나 ChatGPT 같은 범용 AI 어시스턴트는 필요한 도메인 지식과 과학 데이터 소스 통합 기능이 부족합니다. 생명공학 분야를 위한 더 전문적인 AI 제품들은 종종 높은 추가 비용(markups)을 부과합니다.
두 경우 모두 에이전트 하네스가 독점적(proprietary)이라서 사용자가 커스터마이징하는 것을 막고, 비싼 폐쇄형 소스 모델에 가두게 만듭니다. 이 문제는 특히 생명과학 분야에서 매우 중요합니다. 왜 시스템이 특정 방식으로 작동했는지 설명할 수 있는 철저한 문서화와 감사 로그(audit logs)가 요구되는 GxP 검증(validations)의 경우, 기업들은 임상 의사 결정에 사용되는 모든 시스템을 완전히 통제해야 합니다.
생명과학 분야를 위한 오픈 소스 에이전트형 어시스턴트
LangChain은 조직이 자체 지능을 소유하는 것이 우위를 점할 것이라고 믿습니다. 우리는 Deep Agents 하네스를 기반으로, 기업들이 자신들의 사용 사례(use-cases)에 맞게 채택하고 수정할 수 있는 템플릿으로서 임상 및 실험실 과학자를 위한 오픈 소스 에이전트형 어시스턴트인 Deep Life Sci를 개발했습니다.
Deep Life Sci는 ClinicalTrials.gov의 60만 건 이상의 등록된 연구 기록, PubMed의 2900만 개 논문 초록(abstracts), 그리고 PubMed Central의 1200만 개 전문(full-text) 기사에 접근할 수 있으며, 서브 에이전트에게 할당하여 한 번에 수백 개의 문서를 검토합니다. 각 에이전트는 LangSmith 샌드박스를 갖추고 있어 임의의 데이터 분석을 수행하기 위해 코드를 안전하게 실행할 수 있습니다. 사용자는 PDF, 이미지, 표 형식 데이터 파일, RIS와 같은 서지 정보 파일, SMILES나 FASTA와 같은 염기서열(sequence) 등을 업로드하여 에이전트가 작업에 포함하도록 할 수 있습니다.

Deep Life Sci를 활용한 예시 에이전트 워크플로우
일반적인 워크플로우에서 연구원(lab scientist)이 RNA-seq 또는 단백질체학 스크리닝 결과를 완료하고 결과 테이블을 업로드합니다. 에이전트는 샌드박스에서 풍부화 분석(enrichment)을 실행하여 차등 발현 유전자(differentially expressed genes)를 식별한 다음, 각 히트(hit)와 표현형(phenotype)을 연결하는 선행 증거를 문헌에서 검색하고, 잘 설명된 유전자를 새로운 유전자와 분리하며, 근거가 되는 논문과 함께 순위가 매겨진 테이블을 반환합니다.

반면, 임상 개발(clinical development) 또는 HEOR 팀은 특정 적응증에서 표준 치료(standard of care)의 모든 출판된 임상 시험을 찾아내고, 종점 값(endpoint value), N, 인구 특성(population characteristics), 추적 관찰 기간(follow-up duration)을 일관되게 추출해야 할 수도 있습니다. 에이전트는 검색을 실행하고 기준에 따라 스크리닝하며, 각 임상 시험을 공통 스키마로 추출한 다음, 테이블과 포레스트 플롯 스타일의 비교 자료를 모두 생성합니다.

임상 시험 단계에서는 정보에 입각한 동의서(informed consent), 임상 프로토콜 문서 및 수정본(clinical protocol documents and amendments), 사례 보고 양식(case report forms) 등 다양한 유형의 수천 페이지 분량의 문서가 생성되며, 이 모든 문서는 최종 확정되기 전에 철저하게 감사(audited)되고 검토(reviewed)되며 여러 번 편집되어야 합니다. Deep Life Sci를 사용하면 사용자가 참고 프로토콜 문서를 업로드하고 연구하여 추가적인 통계 정보를 수집할 수 있으며, 궁극적으로 임상 문서화 시간을 크게 단축시킬 수 있는 필요한 피드백과 수정 사항을 신속하게 큐레이션(curate)할 수 있습니다.
연구 및 개발 분야에서 자체 지식 보유하기
Deep Life Sci의 가치는 에이전트가 회사 생태계에 최적화되고 통합될 때 더욱 커집니다. Deep Life Sci는 주요 종점(primary endpoint)이 무엇인지는 알지만, 내부 분석 결과, 규제 기관이 거부했던 종점, 또는 단순히 약속만 한 것이 아니라 실제로 등록된 임상 시험 사이트와 같은 회사별 미묘한 차이는 알지 못합니다.
이러한 컨텍스트를 하네스에 통합하는 것이 바로 지능을 소유한다는 것의 실제적인 모습이며, Deep Life Sci의 코드가 오픈 소스이기 때문에 조직은 원하는 방식으로 접근할 수 있습니다. 이러한 맞춤화에는 내부 데이터 및 문서와의 통합 추가, 다양한 최첨단(frontier) 모델과 오픈 소스 모델 활용, 가드레일(guardrails) 및 승인 게이트(approval gates) 적용 등이 포함될 수 있습니다.
하네스를 수정하는 것은 여러분을 에이전트 개발 생명주기(Agent Development Lifecycle, ADLC): 구축(build), 테스트(test), 배포(deploy), 모니터링(monitor) 단계 안에 놓게 하며, 여기서 학습한 내용을 다음 버전에 다시 공급할 수 있습니다. 추적(Tracing)과 평가(Evaluations)는 이 개발 루프를 구동하는 데 도움을 줍니다.
추적(Tracing): 에이전트가 무엇을 하는지 파악하기
Deep Life Sci의 모든 실행은 에이전트가 수행한 문헌 검색, 샌드박스에서 실행된 코드, 각 서브 에이전트가 읽은 문서, 그리고 그것들이 답변으로 어떻게 이동했는지 등 전체 과정(end-to-end)이 사용자의 LangSmith 계정에 기록됩니다. 이러한 궤적(trajectories)은 에이전트의 디버깅과 개선을 가능하게 하며 감사 기록(audit record) 역할을 합니다.
평가(Evaluations): 에이전트를 지속적으로 개선하기
평가는 에이전트에 대한 변경 사항이 성능 향상에 도움이 되었는지 알려줍니다. Deep Life Sci는 기본 평가 세트(default eval set)와 함께 제공되며, 통합을 추가하고 새로운 사용 사례를 식별함에 따라 수정하거나 추가할 수 있습니다. 모델을 교체하거나 프롬프트를 재작성하기 전과 후에 이 세트를 실행해 보면, 새 버전이 실제로 개선되었는지 아니면 조용히 퇴보했는지를 알 수 있습니다.
에이전트형 AI(Agentic AI)는 이미 코딩 및 수학 같은 분야를 혁신하고 있습니다. 비용 효율성과 반복 속도가 곧 인간의 생명 구호로 직결되는 생물의학(Biomedicine) 분야가 뒤처져서는 안 됩니다. Deep Life Sci와 같은 오픈 소스 도구와 LangSmith의 ADLC 기능을 결합하는 바이오테크 및 제약 회사들은 약물 개발 주기 전반에 걸쳐 비용 절감과 빠른 반복을 제공함으로써 이룸의 법칙(Eroom’s law)을 역전시킬 수 있습니다.
Deep Life Sci를 여기서 시작하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 LangChain Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기