완전 개방형 Meditron: 임상용 LLM을 위한 감사 가능한 파이프라인
요약
임상 의사 결정 지원 시스템(CDSS)의 투명성을 높이기 위해 데이터 출처부터 학습 프레임워크, 평가 프로토콜까지 전 과정을 공개하는 'Fully Open Meditron' 파이프라인을 제안합니다. 이 파이프라인은 임상 의사가 검증한 데이터셋과 엄격한 오염 방지 절차를 포함하며, 다양한 베이스 모델에 적용했을 때 기존 모델보다 뛰어난 의료 성능을 입증했습니다. 특히 Apertus-70B-MeditronFO는 새로운 FO SoTA를 기록하며 완전 개방형 방식의 효용성을 증명했습니다.
핵심 포인트
- 기존 open-weight 모델과 달리 데이터 큐레이션 및 생성 파이프라인 전체를 공개하는 완전 개방형(Fully Open) 접근 방식 도입
- 임상 의사가 검증한 8개의 QA 데이터셋과 합성 확장 데이터셋을 활용한 고품질 학습 코퍼스 구축
- 오염 방지(decontamination) 및 골드 라벨 재샘플링 등 재현 가능한 학습 스택 제공
- Apertus-70B 및 Gemma-3-27B 기반 모델이 기존 의료 특화 모델(MedGemma 등) 대비 우수한 성능 기록
임상 의사 결정 지원 시스템 (CDSS)은 엄격하고 재현 가능한 검증을 가능하게 하는 조사 가능하고 감사 가능한 (auditable) 파이프라인을 필요로 합니다. 그러나 현재의 LLM 기반 CDSS는 여전히 대체로 불투명한 상태입니다. 대부분의 "개방형" 모델은 가중치만 공개하는 open-weight 방식이며, 모델의 동작을 결정하는 데이터 출처 (data provenance), 큐레이션 절차 및 생성 파이프라인은 공개하지 않습니다. 전체 학습 스택을 엔드 투 엔드 (end-to-end)로 노출하는 완전 개방형 (Fully Open, FO) 모델은 현재 의료 분야에 존재하지 않습니다.
우리는 임상 의사가 검토한 학습 코퍼스 (training corpus), 재현 가능한 데이터 구축 및 학습 프레임워크, 그리고 사용 목적에 부합하는 평가 프로토콜로 구성된, LLM-CDSS 구축을 위한 최초의 완전 개방형 파이프라인인 Fully Open Meditron을 소개합니다. 이 코퍼스는 8개의 공개 의료 질의응답 (QA) 데이터셋을 정규화된 대화 형식으로 통합하며, 임상 의사가 검증한 세 가지 합성 확장 데이터셋인 시험 스타일 QA, 46,469개의 임상 진료 지침에서 도출된 지침 기반 QA, 그리고 임상 사례 (clinical vignettes)를 통해 범위를 확장합니다. 이 파이프라인은 시스템 전반의 오염 방지 (decontamination), 교사 모델 생성 데이터의 골드 라벨 재샘플링 (gold-label resampling), 그리고 4명의 의사 패널에 의한 엔드 투 엔드 검증을 강제합니다.
우리는 204명의 인간 평가자와 보정된, 전문가가 작성한 임상 사례를 대상으로 LLM-as-a-judge 프로토콜을 사용하여 평가를 수행합니다. 우리는 이 레시피를 5개의 FO 베이스 모델 (Apertus-70B/8B-Instruct, OLMo-2-32B-SFT, EuroLLM-22B/9B-Instruct)에 적용했습니다. 모든 MeditronFO 변형 모델은 베이스 모델보다 선호되었습니다. Apertus-70B-MeditronFO는 종합 의료 벤치마크에서 베이스 모델 대비 +6.6포인트(47.2%에서 53.8%로) 향상되어 새로운 FO SoTA (State-of-the-Art)를 수립했습니다. Gemma-3-27B-MeditronFO는 LLM-as-a-judge 비교에서 58.6%의 비율로 MedGemma보다 선호되었으며, HealthBench에서도 이를 능가했습니다 (58% 대 55.9%). 이러한 결과는 완전 개방형 파이프라인이 감사 가능성이나 재현성을 희생하지 않고도 최첨단 도메인 특화 성능을 달성할 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기