MIRROR: 멀티모달 추론을 위한 타 관점 학습 (Learning from the Other View for Multi-Modal
요약
시각-언어 모델(VLM)이 텍스트와 이미지 등 서로 다른 뷰(view)에서 일관되지 않은 추론 성능을 보이는 문제를 해결하기 위한 연구입니다. ODA-Data 데이터셋과 MIRROR 강화 학습 방식을 통해 멀티모달 추론의 일관성과 정확도를 높였습니다.
핵심 포인트
- 텍스트와 이미지 뷰 간의 추론 불일치 현상 규명
- 고품질 쌍체 멀티모달 기하학 데이터셋 ODA-Data 구축
- 자기 지도 학습 기반의 MIRROR 강화 학습 접근법 제안
- 가장 성능이 좋은 뷰를 교사로 활용하는 역-KL 목적 함수 적용
- 표준 RL 대비 멀티모달 추론 성능 및 일관성 개선
강력한 추론 능력을 보여주는 대규모 언어 모델 (LLMs)과 달리, 시각-언어 모델 (VLMs)은 텍스트, 도표, 그리고 결합된 도표+텍스트 뷰가 동일하게 허용되는 기하학 문제에서도 시각적 추론에 어려움을 겪습니다. 우리는 이러한 뷰(view)들이 종종 서로 다른 동작을 유도한다는 것을 보여줍니다. 즉, 모델이 텍스트로는 문제를 해결할 수 있지만 대응하는 도표에서는 실패하거나, 텍스트로는 실패하면서 시각적으로는 성공할 수 있습니다. 이러한 불일치는 서로 다른 뷰가 표준적인 멀티모달 사후 학습 (multimodal post-training)이 충분히 활용하지 못하는 상호 보완적인 추론 경로와 실패 모드 (failure modes)를 드러낸다는 것을 시사합니다. 이 현상을 연구하고 활용하기 위해, 우리는 동일한 문제에 대해 텍스트 중심, 이미지 중심, 그리고 결합된 이미지+텍스트 뷰를 포함하며, 양식 의존적 (modality-dependent) 추론 동작을 훈련하고 평가하기 위한 분할 데이터가 포함된 고품질 쌍체 멀티모달 기하학 데이터셋인 ODA-Data를 구축합니다. 그런 다음, 우리는 자기 지도 학습 (self-supervision)을 통해 멀티모달 추론을 개선하기 위한 강화 학습 (RL) 접근 방식인 양식 정보 상호 추론 최적화 (Modality-Informed Reciprocal Reasoning Optimization, MIRROR)를 개발합니다. 각 문제에 대해, MIRROR는 모든 뷰에서 모델을 평가하고, 가장 성능이 좋은 뷰를 교사 (teacher)로 선택하며, 교사를 향한 역-KL 목적 함수 (reverse-KL objective)를 사용하여 다른 뷰들을 학습시킵니다. 기하학 문제를 평가하는 추론 벤치마크 전반에 걸쳐, MIRROR는 표준 강화 학습 (RL)보다 성능을 개선하며 양식 전반에 걸쳐 더 정확하고 일관된 동작을 생성합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기