MedicalHarness: 의료 작업에 대한 LLM 및 에이전트 하네스 제어 평가
요약
본 논문은 의료 작업을 위한 LLM 에이전트의 성능을 평가하는 새로운 벤치마크인 MedicalHarness를 제안합니다. 이 시스템은 모델과 환경(하네스) 간의 상호작용을 체계적으로 분석하여, 하네스가 결과에 미치는 영향을 측정하고 개별 메커니즘의 기여도를 밝힙니다.
핵심 포인트
- MedicalHarness는 의료 작업을 위한 LLM 에이전트 평가 벤치마크입니다.
- 모델-하네스 쌍의 속성을 측정하며, 하네스의 변화가 결과에 미치는 영향을 분석합니다.
- MH-Lab을 통해 컨텍스트 관리, 계획, 도구 노출 등 개별 메커니즘의 기여도를 연구할 수 있습니다.
LLM 에이전트는 의료 작업을 위해 구축되고 임상 벤치마크에서 점수를 받는 경우가 증가하고 있습니다. 하지만 이러한 각 점수는 모델이 에이전트 하네스(agent harness) 내부에서 실행되는 것, 즉 모델과 그 환경 사이의 루프를 제어하는 시스템으로부터 나옵니다. 따라서 에이전트의 점수는 모델-하네스 쌍(model--harness pair)의 속성입니다. 의료 에이전트의 경우, 하네스가 결과에 얼마나 많은 변화를 주는지 측정된 경우는 드뭅니다. 이 변화를 측정하고 설명하는 것은 두 가지 과제를 제기합니다. 첫째, 하네스 비교는 하네스만 변경해야 하며 모델과 작업 종류 전반에 걸쳐 반복되어야 합니다. 둘째, 전체 하네스를 비교하면 그 메커니즘들이 묶여버리기 때문에 어떤 개별 메커니즘이 도움이 되는지 보여줄 수 없습니다. 이러한 과제들을 해결하기 위해, 우리는 의료 작업을 위한 모델 및 에이전트 하네스에 대한 통제된 연구인 MedicalHarness를 제시합니다. 먼저, 우리는 네 가지 도메인에 걸쳐 $107$개의 작업에서 에이전트를 평가하기 위해 MedicalHarnessBench를 구축했습니다. 이 벤치마크를 사용하여, 우리는 다섯 개의 오픈 가중치 모델(open-weight models)을 다섯 개의 에이전트 하네스 아래서 실행하며, 비교 시 오직 하네스만 변경하고 결과와 실행 추적(execution traces) 모두를 분석합니다. 개별 메커니즘을 연구하기 위해, 우리는 공유된 실행 루프 내에서 컨텍스트 관리(context management), 계획(planning), 또는 도구 노출(tool exposure) 중 하나를 한 번에 끄는 통제된 하네스인 MH-Lab을 구축했습니다. 우리는 하네스와 모델 간의 상호작용이 결과 분산의 약 4분의 1을 차지하며, 어떤 단일 하네스가 모든 모델과 작업에서 최고라는 것은 없다는 것을 발견했습니다. 코드와 데이터는 https://github.com/REAL-Lab-NU/MedicalHarness에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기