대규모 시각 언어 모델(LVLM)의 흉부 X-ray 추론을 위한 시각적 귀인(Visual Attribution) 재고
요약
대규모 시각 언어 모델(LVLM)이 의료 영상 분석 시 시각적 증거에 기반하지 못하는 문제를 해결하기 위해, 반사실적 편집을 활용한 새로운 인과적 평가 프레임워크를 제안합니다. 연구 결과 기존의 시각적 귀인 방법론들이 모델의 실제 근거를 식별하는 데 한계가 있음을 확인하였으며, 이를 개선하기 위해 불균형 최적 운송 기반의 MedFocus 방법론을 개발했습니다. MedFocus는 임상적으로 유의미한 영역을 국소화하고 인과적 효과를 측정하여 기존 방식보다 뛰어난 설명력을 제공합니다.
핵심 포인트
- LVLM의 의료 영상 분석 시 시각적 근거(grounding) 부족은 임상적 신뢰성을 저해하는 주요 요인임
- 기존의 시각적 귀인 방법론들은 모델이 실제로 사용한 증거를 정확히 식별하지 못하는 경우가 많음
- 반사실적 편집을 통해 모델의 예측에 인과적 책임이 있는 샘플만을 선별하는 평가 프레임워크 개발
- 불균형 최적 운송(unbalanced optimal transport)을 활용한 개념 기반 귀인 방법론인 MedFocus 제안
- MedFocus는 공간적, 개념적, 토큰 수준에서 기존 방법론보다 우수한 성능을 입증함
대규모 시각 언어 모델(Large Vision Language Models, LVLMs)은 의료 분야 응용에서 가능성을 보여주고 있지만, 응답을 시각적 증거에 충실하게 근거(grounding)하지 못하는 점은 임상적 신뢰성에 대한 심각한 우려를 불러일으킵니다. 시각적 귀인(visual attribution) 방법론이 LVLM의 예측을 설명하기 위해 널리 사용되고 있지만, 모델 내부 추론에 대한 정답(ground-truth) 주석을 일반적으로 사용할 수 없기 때문에 이러한 설명이 모델의 결정 기저에 있는 시각적 증거를 실제로 반영하는지는 대부분 검증되지 않은 상태입니다. 우리는 반사실적 편집(counterfactual editing)을 통해 전문가가 주석을 단 영역이 모델의 예측에 인과적 책임이 있다고 확인된 CXR-VQA 샘플만을 유지하는 인과적 평가 프레임워크를 개발함으로써, 흉부 X-ray (CXR) 추론에 대한 이 문제를 다룹니다. 이 프레임워크를 11가지 귀인 방법, 6개의 오픈 소스 LVLM, 그리고 두 가지 출력 모드(직접 답변 및 단계별 추론)에 적용한 결과, 기존의 귀인 방법들이 LVLM이 사용한 증거를 식별하는 데 자주 실패한다는 것을 발견했습니다. 이러한 실패를 해결하기 위해, 우리는 불균형 최적 운송(unbalanced optimal transport)을 통해 임상적으로 의미 있는 해부학적 영역을 국소화하고 표적 개입(targeted interventions)을 통해 모델 출력에 미치는 인과적 효과를 측정하는 개념 기반 귀인 방법인 MedFocus를 제안합니다. MedFocus는 공간적(spatial), 개념적(concept-level), 토큰 수준(token-level)의 귀인을 생성하며 기존 방법보다 실질적으로 뛰어난 성능을 보여줌으로써, 의료용 LVLM을 위한 더 신뢰할 수 있는 귀인을 향한 한 걸음을 내디뎠습니다. 우리의 데이터와 코드는 https://github.com/gzxiong/medfocus/ 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기