PathView-Bench: 멀티모달 거대 언어 모델(MLLM)이 병리 이미지의 미세한 다중 스케일 이해를 달성할 수 있는가?
요약
병리 이미지 분석을 위한 MLLM의 다중 스케일 시각적 이해 능력을 평가하는 새로운 벤치마크 PathVU를 소개합니다. 기존 벤치마크의 한계를 넘어 영역 국소화, 시각적 인식, 공간 추론 등 미세한 분석 능력을 정밀하게 측정합니다.
핵심 포인트
- 병리 이미지의 다중 스케일 이해를 위한 비전 기반 벤치마크 PathVU 제안
- 고해상도 영역(Region FOV)과 전체 슬라이드(Slide FOV) 시야를 모두 평가
- 영역 국소화, 수량 추정, 공간 추론 등 14가지 VQA 스타일 작업 포함
- 기존 고급 MLLM들도 미세한 병리 시각 작업에서는 한계가 있음을 확인
멀티모달 거대 언어 모델 (Multimodal Large Language Models, MLLMs)은 병리 이미지를 분석하는 데 점점 더 많이 사용되고 있습니다. 그러나 병리 분야의 지배적인 멀티모달 벤치마크는 주로 최종 진단 답변, 캡션(captions) 또는 보고서(reports)에 점수를 매깁니다. 이러한 평가는 모델이 병리적 추론 및 의사결정에 필요한 다중 스케일(multiscale) 시각적 콘텐츠를 이해하고 있는지에 대해 제한적인 통찰만을 제공합니다. 우리는 계산 병리학(computational pathology)에서 미세하고 다중 스케일인 시각적 이해를 위한 비전 기반(vision-anchored) 벤치마크인 PathVU를 소개합니다. 인간이 감독한 레이블(labels)과 공간 주석(spatial annotations)이 포함된 23개의 공개 병리 영상 데이터셋을 기반으로 구축된 PathVU는 두 가지 시야(fields of view)에서 MLLM의 이해도를 평가합니다: 고해상도 국소 영역을 위한 영역 FOV (Region FOV) 및 거시적 전체 슬라이드 뷰를 위한 슬라이드 FOV (Slide FOV)입니다. 원시 주석을 결정론적 작업 목표(deterministic task targets)로 변환함으로써, PathVU는 영역 국소화(region localization), 시각적 인식(visual recognition), 수량 추정(quantity estimation), 공간 추론(spatial reasoning) 및 문맥 부족 판단(insufficient-context judgment)에 대한 프로그래밍 방식의 점수 산출을 가능하게 합니다. 이 벤치마크는 28개 장기와 7,253,526개의 주석에 걸쳐 14개의 VQA 스타일 작업, 61,673개의 이미지 및 308,070개의 샘플을 포함합니다. 18개의 대표적인 범용, 의료 도메인 및 병리 지향적 MLLM을 평가한 결과, 우리는 다중 스케일 병리 이미지 전반의 미세한 시각적 작업에서 고급 모델조차 상당한 한계가 있음을 관찰했습니다. PathVU는 명시적인 다중 스케일 시각적 이해를 갖춘 병리 MLLM을 개발하고 평가하기 위한 재현 가능한 기반을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기