ClinFusion: 총체적 의료 이해를 위한 시각 중심 멀티모달 LLM 시스템
요약
ClinFusion은 2D 및 3D 의료 영상을 통합적으로 이해하기 위해 설계된 시각 중심 멀티모달 LLM 시스템입니다. 계층적 시각 인코더와 새로운 평가 프레임워크를 통해 의료 영상 분석 및 보고서 생성에서 최첨단 성능을 달성했습니다.
핵심 포인트
- 2D 및 네이티브 3D 의료 영상을 결합하는 계층적 시각 인코더 제안
- MedIF-Bench 및 RoI 기반의 새로운 시각 기반 평가 프레임워크 도입
- 다수의 벤치마크에서 오픈 소스 및 폐쇄형 모델(GPT, Gemini 등)을 능가
- 영상의학 전문의 테스트를 통해 임상적 유효성 및 보고서 품질 검증
멀티모달 거대 언어 모델 (Multimodal Large Language Models, MLLMs)은 임상 실무를 혁신할 엄청난 잠재력을 보유하고 있지만, 이를 의료 영역에 배포하는 것은 근본적으로 시각 중심적인 (vision-centric) 과제입니다. 즉, 모델은 이질적인 2D 및 3D 의료 영상으로부터 지식을 흡수해야 하며, 평가 프로토콜은 영상의학 전문의의 임상 실무와 일치하면서도 정확하고 세밀하며 사실성에 기반한 평가를 제공해야 합니다. 본 논문에서는 이러한 한계점들을 체계적으로 해결하기 위해, 총체적인 의료 이해를 위해 설계된 시각 중심 MLLM인 ClinFusion을 소개합니다. 우리는 통합된 인코더 내에서 다양한 2D 및 네이티브 3D 의료 영상 이해를 결합하는 Cascade Spatial-Aware Locality Fusion 연산자를 특징으로 하는 구성적이고 계층적인 시각 인코더 (vision encoder) 아키텍처를 제안합니다. 나아가, 지시 이행 (instruction-following) 평가를 위한 MedIF-Bench와 임상적으로 정렬되고 사실성에 기반한 보고서 생성 평가를 위한 관심 영역 (region-of-interest, RoI) 기반 방법을 포함하는 시각 기반 평가 프레임워크를 도입합니다. 우리는 ClinFusion이 시각적 질의응답 (visual question answering), 보고서 생성, 지시 이행을 아우르는 포괄적인 2D 및 3D 멀티모달 의료 벤치마크뿐만 아니라 텍스트 기반 의료 작업 전반에 걸쳐 새로운 최첨단 (state-of-the-art) 성능을 설정함을 보여줍니다. ClinFusion은 24개 벤치마크 중 20개에서 주요 오픈 소스 의료 MLLM (예: Hulu-Med, Lingshu)을 능가하였으며, 16개 벤치마크 중 13개에서 GPT-5.2 및 Gemini-3-Flash와 같은 강력한 폐쇄형 모델 (proprietary models)보다 뛰어난 멀티모달 능력을 입증했습니다. 또한, 검색 증강 (retrieval-augmented) 및 도구 지원 임상 워크플로우를 위해 에이전트 도구 사용 (agentic tool use)으로 더욱 확장될 수 있습니다. 전문의 자격을 갖춘 영상의학 전문의의 블라인드 테스트 결과, ClinFusion이 가장 높은 순위의 보고서를 생성함을 확인하였으며, 우리의 RoI 기반 지표가 검토된 모든 자동 평가 지표 중 전문가의 판단과 가장 강력한 상관관계를 달성함을 검증하였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기