PromptRad: 저자원 방사선 보고서 라벨링을 위한 지식 강화형 멀티 라벨 프롬프트 튜닝 (Prompt-Tuning)
요약
PromptRad는 데이터가 부족한 의료 환경에서 방사선 보고서를 효율적으로 라벨링하기 위해 제안된 지식 강화형 멀티 라벨 프롬프트 튜닝 방식입니다. UMLS Metathesaurus의 유의어를 활용하여 카테고리 표현을 풍부하게 하며, 마스크 언어 모델링 방식으로 문제를 재구성하여 적은 데이터로도 높은 성능을 구현합니다. 실험 결과, 매우 적은 학습 데이터만으로도 기존 미세 조정 방식 및 GPT-4와 경쟁할 만한 성능을 보였습니다.
핵심 포인트
- 저자원(low-resource) 환경에 최적화된 방사선 보고서 멀티 라벨 분류 기술
- UMLS Metathesaurus를 활용한 멀티 워드 버벌라이저로 카테고리 표현력 강화
- 추가 분류 레이어 없이 PLM을 직접 활용하여 데이터 효율성 극대화
- 복잡한 부정 패턴(negation patterns) 포착 능력 우수
- 단 32개의 학습 데이터만으로도 기존 베이스라인 및 대형 모델과 경쟁 가능한 성능 달성
자동 보고서 라벨링 (Automatic report labeling)은 비정형 텍스트에서 임상적 소견을 식별하는 것을 용이하게 하며, 의료 영상 연구를 위한 대규모 주석 (annotation)을 가능하게 합니다. 기존의 규칙 기반 라벨러 (rule-based labelers)는 임상 보고서의 다양한 설명에 대응하는 데 어려움을 겪는 반면, 사전 학습된 언어 모델 (PLMs)을 미세 조정 (fine-tuning)하는 것은 임상 환경에서 흔히 구할 수 없는 대량의 라벨링된 데이터를 필요로 합니다. 본 논문에서는 저자원 (low-resource) 환경에서의 방사선 (radiology) 보고서 라벨링을 위해 지식 강화형 멀티 라벨 프롬프트 (prompt)-튜닝 접근 방식인 PromptRad를 제안합니다. PromptRad는 멀티 라벨 분류 (multi-label classification)를 마스크 언어 모델링 (masked language modeling)으로 재구성하며, 카테고리 표현을 풍부하게 하기 위해 UMLS Metathesaurus의 유의어들을 멀티 워드 버벌라이저 (multi-word verbalizer)에 통합합니다. 추가적인 분류 레이어 없이 PLM을 미세 조정함으로써, PromptRad는 기존의 미세 조정 방식보다 실질적으로 더 적은 라벨링된 데이터를 필요로 합니다. 간 CT 보고서에 대한 실험 결과, PromptRad는 단 32개의 라벨링된 학습 예시만으로도 사전 기반 (dictionary-based) 및 미세 조정 베이스라인 (baselines)보다 뛰어난 성능을 보였으며, 훨씬 더 작은 모델을 사용함에도 불구하고 GPT-4와 경쟁력 있는 성능을 달성했습니다. 추가 분석을 통해 PromptRad가 기존 방법들보다 복잡한 부정 패턴 (negation patterns)을 더 효과적으로 포착함을 입증하였으며, 이는 데이터가 부족한 임상 시나리오에서의 보고서 라벨링을 위한 유망한 솔루션임을 보여줍니다. 저희의 코드는 https://github.com/ila-lab/PromptRad 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기