KANEx: Kolmogorov-Arnold Networks의 해석 가능성을 의료적 설명 가능성으로 변환하기
요약
KANEx는 Kolmogorov-Arnold Networks(KAN)의 구조적 투명성을 활용하여 의료용 시각-언어 모델(VLM)의 설명 가능성을 높이는 프레임워크입니다. KAN의 스플라인 기반 특성을 통해 모델의 추론 근거를 수학적으로 해석 가능한 단위로 제공하며, 의료 AI의 신뢰성을 향상시킵니다.
핵심 포인트
- KAN의 상징적 투명성을 활용한 VLM 추론 근거 생성
- 경사도 근사치가 아닌 KAN 모델 직접 유도 방식의 KAN-Map 설계
- MIMIC-CXR 데이터셋 기준 시각적 국소화 및 추론 품질 10% 향상
- 의료 AI의 블랙박스 문제를 해결하기 위한 수학적 해석 가능성 제시
컴퓨터 비전 (Computer vision) 모델은 의료 분야에서 매우 효과적으로 활용되고 있지만, 그 블랙박스 (black-box) 특성은 여전히 임상의의 신뢰를 저해하고 있습니다. 임상 워크플로 (clinical workflows)에서 흉부 X-ray 분류기는 자연어 설명을 생성하기 위해 시각-언어 모델 (Vision-Language Models, VLMs)과 점점 더 많이 결합되고 있습니다. 그러나 이러한 시스템은 시각 모델의 근본적인 불투명성을 해결하지 못한 채 언어적 유창성만을 더할 뿐입니다. 스플라인 (spline) 기반 구성 요소가 본질적으로 해석 가능한 기능 단위를 제공하는 Kolmogorov-Arnold Networks (KANs)의 등장과 함께, 우리는 이러한 구조적 투명성을 활용하여 더 신뢰할 수 있는 텍스트 설명을 생성할 수 있는지 조사합니다. 우리는 KAN의 상징적 투명성 (symbolic transparency)을 활용하여 VLM의 추론을 근거 지우는 최초의 프레임워크인 KANEx를 소개합니다. 이러한 해석 가능성은 또한 경사도 근사치 (gradient approximations)가 아닌 KAN 모델에서 직접 유도된 새로운 히트맵 생성 방법인 KAN-Map을 설계할 수 있게 했습니다. 우리는 이러한 근거가 있는 문맥을 다운스트림 (downstream) VLM에 입력하여 설명 가능성을 향상시킵니다. MIMIC-CXR 데이터셋을 통해 벤치마크를 수행한 결과, ResNet/ViT 베이스라인을 사용한 KAN 기반 아키텍처가 향상된 의미적 유사성 (semantic similarity)을 보여주는 동시에 훨씬 더 충실한 (faithful) 돌출 맵 (saliency maps)을 생성함을 입증했습니다. KAN 아키텍처는 시각적 국소화 (visual localization) 및 다운스트림 추론 품질을 10% 향상시킵니다. 우리의 연구 결과는 언어적 설명과 시각적 귀속 (visual attributions)을 수학적으로 해석 가능한 단위에 근거 지우는 것이 신뢰할 수 있는 의료 AI로 나아가기 위한 필수적인 단계임을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기