ScaFE: LLM 생성 임상 특징 프로그램을 활용한 데이터 효율적 흉터 분류
요약
ScaFE는 LLM의 임상 지식을 활용해 데이터 효율적인 흉터 분류를 수행하는 새로운 프레임워크입니다. 이미지를 직접 전송하는 대신 로컬에서 실행 가능한 특징 프로그램을 합성하여 데이터 보안을 유지하면서도 높은 분류 정확도를 달성했습니다.
핵심 포인트
- LLM이 임상 지식을 바탕으로 결정론적인 특징 프로그램을 합성함
- 원본 이미지 노출 없이 로컬 환경에서 특징만 추출하여 데이터 보안 강화
- BiomedCLIP 대비 사이트-매크로 균형 정확도 10.0%p 향상
- 적은 데이터(10%)로도 높은 성능을 유지하는 데이터 효율성 입증
임상 사진으로부터 병리적 흉터를 분류하는 작업은 전문가가 라벨링한 데이터가 제한적이고 병원마다 데이터 수집 방식의 차이가 크기 때문에, 켈로이드(keloids)와 비후성 흉터(hypertrophic scars)를 구분해내는 것을 필요로 합니다. 엔드투엔드(End-to-end) 이미지 모델은 여전히 데이터 의존적이며, 사진을 호스팅된 시각-언어 모델(VLM)로 전송하는 방식은 지역 데이터 거버넌스(data-governance) 요구 사항과 충돌할 수 있고 재현 및 감사가 어려운 결정을 내릴 수 있습니다. 우리는 모델에게 이미지를 진단하도록 요청하는 대신, 대규모 언어 모델(LLM)의 임상 지식을 결정론적이고 실행 가능한 특징 프로그램(feature programs)으로 전달하는 ScaFE (Scar Feature Engineering)를 소개합니다. 웹 기능이 탑재된 LLM은 임상적 근거를 검색하고 시각적으로 평가 가능한 흉터 속성을 측정하는 프로그램을 합성합니다. 후보 프로그램은 제한된 로컬 환경에서 실행되며, 반복적인 수정 및 개선을 위해 집계된 검증 통계와 특징 수준의 SHAP 요약만이 반환됩니다. 즉, 원본 이미지와 환자 수준의 출력값은 로컬에 유지됩니다. 이후 경량화된 랜덤 포레스트(Random Forest)가 결과로 도출된 구조화된 표현(structured representation)을 바탕으로 작동합니다. Leave-one-site-out 평가 방식 하에 3개 병원의 사진 600장을 대상으로 실험한 결과, ScaFE는 81.0%의 사이트-매크로 균형 정확도(site-macro balanced accuracy)를 달성하였으며, 이는 가장 강력한 베이스라인인 BiomedCLIP보다 10.0%포인트 높은 수치입니다. 개발 데이터의 10%만을 사용했을 때도 ScaFE는 72.0%의 균형 정확도를 유지하며 11.8%포인트의 격차를 유지했습니다. 반복적인 개선을 통해 실행 가능한 프로그램 비율은 66.7%에서 95.0%로 상승했으며, 최종 특징의 91.7%에 대해 검증된 근거를 확보했습니다. 이러한 결과는 LLM의 지식이 직접적인 VLM 결정 대신 로컬에서 실행 가능하고 감사가 가능한 특징 프로그램을 통해 데이터 효율적이고 교차 사이트(cross-site) 의료 이미지 분류를 지원할 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기