
📄논문: RORA-VLM: Vision Language Models를 위한 강건한 검색 증강 (Robust Retrieval
요약
ICLR 2025에 발표된 RORA-VLM은 Vision Language Models(VLM)를 위한 강건한 검색 증강 프레임워크를 제안합니다. 검색된 지식에 노이즈가 포함되어 있더라도 VLM이 안정적으로 추론할 수 있도록 2단계 검색 방식을 활용합니다.
핵심 포인트
- VLM의 추론 능력을 높이기 위한 RAG 프레임워크 제안
- 이미지 기반 엔티티 검색 후 텍스트 확장을 수행하는 2단계 검색 방식
- 검색된 지식의 노이즈에 대응하는 강건한 추론 메커니즘
- WIT 데이터베이스와 Google API를 활용한 지식 확장
공개 장소
International Conference on Learning Representations (ICLR) 2025
💡 이 논문을 읽은 이유
최근 논문 아이디어를 찾던 중 마침 이 논문을 발견했습니다. ICLR 2025에 발표되었지만, Reject된 점은 조금 아쉽네요.
이 논문은 주로 RAG (Retrieval-Augmented Generation)를 VLM (Vision Language Models)에 적용하여, 모델이 질문에 답할 때 외부 지식을 활용할 수 있도록 합니다.
많은 VQA (Visual Question Answering) 태스크에서 정답은 사실 이미지 안에 있는 것이 아니라, 추가적인 배경 지식이 필요합니다.
예를 들어, 한 장의 사진이 어떤 새를 보여주고 질문이 "이 새는 주로 어디에 분포하나요?"라고 한다면,
이미지는 새가 어떻게 생겼는지만 보여줄 뿐, 서식지와 같은 정보는 반드시 자료를 찾아봐야 알 수 있습니다.
이 논문은 주로 "검색된 지식(retrieved knowledge)에 노이즈가 있을 때, VLM이 어떻게 안정적으로 추론할 수 있는가?"를 해결하고자 합니다.
🧠 핵심 아이디어 (Core idea)
저자는 VLM을 위한 강건한 검색 프레임워크(robust retrieval framework)를 제안합니다:
1. 2단계 검색 (Two-stage retrieval)
먼저 이미지를 통해 유사한 엔티티(entity)를 검색하고, 그 다음 엔티티 확장(entity expansion)을 통해 텍스트 검색을 수행합니다.
첫 번째 단계에서는 쿼리 이미지(query image)를 하나의 "앵커(anchor)"로 사용하여, 데이터베이스에서 매우 유사하게 생긴 이미지들을 많이 찾습니다.
그들이 사용하는 데이터베이스는 WIT로, 3,700만 장의 이미지가 포함되어 있으며 각 이미지에는 엔티티의 이름과 설명이 함께 매칭되어 있습니다.
두 번째 단계에서는 첫 번째 단계에서 얻은 엔티티 이름과 설명을 원래의 질문에 추가하여 더 구체적인 쿼리로 만든 뒤, Google을 통해 지식을 검색(API 호출)합니다.
✨ 예시
- 원래 질문:
- which year was this building built?
- 찾은 엔티티:
- Castle of Good Hope
- 새로운 쿼리 (원래 질문 + 엔티티):
- which year was Castle of Good Hope built?
2. 쿼리 지향적 시각적 토큰 정제 (Query-oriented visual token refinement)
쿼리와 가장 관련 있는 시각적 토큰(visual tokens)만 유지하여 이미지 배경 노이즈(image background noise)를 줄입니다.
처음에는 질문과 이미지라는 두 가지 입력이 있습니다.
VLM 내에서 이미지는 여러 개의 조각(patch)으로 나뉘며, 각 조각은 하나의 시각적 토큰(visual token)이 됩니다.
그 다음, 모델은 질문의 내용에 따라 각 이미지 패치(image patch)와 쿼리 사이의 관련성을 계산합니다.
질문과 비교적 관련이 있는 조각들은 유지되고, 관련 없는 조각들은 무시됩니다.
검색된 각 이미지에 대해서도 동일한 필터링을 수행하며, "쿼리 이미지의 비교적 중요한 몇몇 패치"를 사용하여 쿼리 이미지와 관련된 조각들만 남깁니다.
최종적으로 남은 이 조각들은 대응하는 시각적 토큰으로 변환되어 시퀀스(sequence) 형태로 배열(정제된 시각적 토큰, refined visual tokens)되며, VLM의 입력(Input)으로 사용됩니다.
즉, 모델이 마지막으로 보는 이미지 정보는 사실 이미 필터링된 상태입니다.
중간에 있는 초록색 블록들은 사실 각 패치 (patch)와 질문 사이의 상관관계 점수를 나타냅니다.
3. 노이즈 내성 RAG (Noise-resilient RAG)
학습 (training) 시 의도적으로 잘못된 검색 결과 (incorrect retrieval)를 추가하여, 모델이 무관한 지식 (irrelevant knowledge)을 무시하도록 학습시킵니다.
VLM은 원본 이미지, 질문, 그리고 검색된 여러 개의 지식 (이미지 + 텍스트)을 동시에 보게 됩니다.
이러한 검색 (retrieval) 결과 중에는 올바른 것도 있고 틀린 것도 있습니다.
모델이 해야 할 일은 관련성 정도 (각 이미지와 쿼리된 이미지 사이의 관계)에 따라 어떤 정보 조각을 신뢰할지 결정하는 것입니다.
👉 초록색 = 높은 어텐션 (high attention)
👉 빨간색 = 무시
이 과정을 거쳐 모델은 "이 건축물은 1666~1679년 사이에 건설되었습니다"와 같은 질문에 답할 수 있습니다.
✨ 전체 워크플로우 (Full Workflow)

📄 출처 (Source)
https://openreview.net/pdf/1dff65b976d44f89183d623a8d26842e17ed51da.pdf
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기


