시각적 및 텍스트적 섭동(Perturbations) 하에서의 시각-언어 모델(Vision-Language Models)의 진단적 견고성 평가
요약
본 연구는 시각-언어 모델(VLM)이 뇌 MRI 데이터셋에서 시각적·텍스트적 섭동에 대해 보이는 진단적 견고성을 평가합니다. 연구 결과, 모델들이 입력 순서 변경이나 텍스트 프레이밍에 매우 취약하며, 높은 정확도가 실제 임상적 신뢰성을 보장하지 못함을 입증했습니다.
핵심 포인트
- VLM의 표준 정확도 지표가 모델의 신뢰성 결함을 은폐할 수 있음
- 슬라이스 순서 변경 시 최대 48.9%의 사례에서 예측이 뒤집힘
- 텍스트 라벨 재정렬에 따른 텍스트 선택 편향 확인
- 임상 적용을 위해 안정성 기반 지표 도입의 필요성 강조
시각-언어 모델(VLMs)의 표준 정확도 지표는 민감한 영역에서의 심각한 신뢰성 실패를 종종 가리는 경향이 있습니다. 본 연구에서는 조직병리학적으로 검증된 뇌 MRI 데이터셋을 활용하여, 증거를 보존하는 섭동(perturbations) 하에서 네 가지 VLM 제품군의 진단적 견고성(diagnostic robustness)을 체계적으로 평가합니다. 해부학적 슬라이스의 순서를 재정렬하고 타겟 라벨의 위치를 교체함으로써, 임상적 증거가 불변할 때 모델이 일관된 예측을 유지하는지 평가합니다. 연구 결과, 제시 순서의 안정성(presentation-order stability)에서 상당한 취약성이 드러났으며, 모델은 단순한 시퀀스 역전 상황에서 최대 48.9%의 사례에서 예측이 뒤집히는 현상을 보였습니다. 나아가 우리는 텍스트 선택 편향(textual selection bias)을 확인하였는데, 동일한 시각적 입력에도 불구하고 라벨 재정렬이 최대 67.8%의 사례에서 일관되지 않은 진단을 유발했습니다. 음성 대조 테스트(Negative-control tests)를 통해 진단적 과잉 확신(diagnostic overcommitment) 또한 확인되었습니다. 전문가가 주석을 달았던 병변 슬라이스를 제거한 후, 모델은 최대 76.1%의 사례에서 범주형 진단을 생성했습니다. 이러한 결과는 높은 정확도가 임상적 신뢰성을 과대평가할 수 있으며, 총체적 정확도(aggregate accuracy)로는 포착되지 않는 순차적 제시 및 텍스트 프레이밍(textual framing)에 대한 민감성을 은폐할 수 있음을 보여줍니다. 우리의 연구 결과는 안전이 중요한 임상 애플리케이션에 VLM을 배치할 때 안정성 기반 지표(stability-based metrics)의 필요성을 강조합니다. 평가 데이터와 코드는 논문 채택 시 공개될 예정입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기