MLLM의 아키텍처 의존적 융합 경로 연구
요약
본 연구는 MLLMs의 시각 및 텍스트 정보 융합 메커니즘을 분석하며, 두 가지 아키텍처 패러다임(연결 방식 vs. 네이티브)에 따른 차이를 규명했습니다. 연결 방식 모델은 텍스트 우선-비전 후반 경로를 따르는 반면, 네이티브 모델은 초기 시각-텍스트 공동 적응을 보여줍니다.
핵심 포인트
- MLLMs의 내부 정보 융합 메커니즘 이해가 필요함.
- 연결 방식 모델과 네이티브 모델 간 뚜렷한 융합 경로 차이가 발견됨.
- 본 연구는 멀티모달 표현에 대한 기계론적 관점을 제공함.
멀티모달 대규모 언어 모델(Multimodal Large Language Models, MLLMs)은 비전-언어 작업 전반에 걸쳐 강력한 성능을 달성하지만, 시각 정보와 텍스트 정보가 레이어별로 어떻게 융합되는지에 대한 내부 메커니즘은 여전히 충분히 이해되지 못하고 있습니다. 우리는 두 가지 아키텍처 패러다임(연결 방식 아키텍처 및 네이티브 멀티모달 아키텍처)의 대표적인 MLLMs를 조사합니다. 이를 위해 세 가지 점진적으로 연결된 분석을 수행합니다: 정렬 분리(alignment decoupling)는 어떤 모달리티가 변화하는지 식별하고, 어텐션 라우팅과 엔트로피(entropy)는 교차 모달 정보가 어떻게 분포되는지를 특성화하며, 본질 차원성(intrinsic dimensionality)은 융합이 특징 공간을 어떻게 재구성하는지를 검토합니다. 별도로, 우리는 결과 해석의 타당성을 검증하기 위해 인과 개입 실험(causal intervention experiments)을 수행합니다. 보조 분석으로, 시각 CKA를 사용하여 플라톤 표현 가설(Platonic Representation Hypothesis)을 조사합니다. 이러한 분석들을 종합하면 두 가지 뚜렷한 융합 경로가 밝혀집니다: 연결 방식 모델은 텍스트 우선-비전 후반 경로를 따르는 반면, 네이티브 모델은 더 이른 시기의 시각-텍스트 공동 적응(co-adaptation)과 특징 공간 재구성을 보여줍니다. 본 연구는 멀티모달 융합을 이해하기 위한 기계론적 관점을 제공하며, 아키텍처 인식 진단(architecture-aware diagnostics)을 통해 멀티모달 표현을 지원합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기