ToolSciVer: 시각적 도구 증강 강화학습을 통한 멀티모달 과학 주장 검증
요약
본 논문은 멀티모달 과학 주장을 검증하기 위한 새로운 프레임워크 ToolSciVer를 제안합니다. ToolSciVer는 VLM에 표/차트 파싱, 영역 확대 등 세 가지 시각적 도구를 장착하여 복잡한 과학 자료에서 명시적인 증거를 추출합니다. 이 프레임워크는 GRPO 기반의 정책 학습을 통해 높은 정확도를 달성했습니다.
핵심 포인트
- ToolSciVer: 멀티모달 과학 주장 검증(MSCV)을 위한 최초 도구 증강 프레임워크.
- VLM에 표/차트 파싱, 영역 확대 등 3가지 시각적 도구를 통합하여 활용.
- GRPO 기반 정책 학습으로 답변 정확성 및 도구 사용 효율성을 최적화함.
- Qwen, InternVL, Gemma 등 다양한 VLM에서 우수한 성능을 입증함.
멀티모달 과학 주장 검증(Multimodal Scientific Claim Verification, MSCV)은 모델이 논문에서 추출된 그림, 표, 차트 및 텍스트 컨텍스트와 같은 시각적으로 근거가 마련된 증거를 사용하여 과학적 주장을 검증하도록 요구합니다. 하지만 기존 방법들은 결정적인 시각적 증거를 찾는 데 어려움을 겪거나, 구조화된 과학적 시각 자료를 정확하게 읽어내지 못하거나, 멀티모달 관찰 결과를 신뢰할 수 있는 추론에 통합하는 데 실패하는 경우가 많습니다. 본 논문에서는 MSCV를 위한 최초의 도구 증강 프레임워크인 ToolSciVer를 소개합니다. ToolSciVer는 VLM(Vision-Language Model)에 세 가지 유형 인식 시각적 도구, 즉 표 행/열 초점 기능(table row/column focus), 차트-구조 파싱(chart-to-structure parsing), 고해상도 영역 확대 기능(high-resolution region zoom)을 장착하여, 복잡한 과학적 시각 자료를 명시적이고 주장에 직접 관련된 증거로 변환합니다. 또한, 이 프레임워크는 답변 정확성, 형식 유효성, 길이 제어, 도구 사용 효율성 및 도구 유효성 페널티의 복합 보상(composite reward) 하에 Group Relative Policy Optimization (GRPO)을 사용하여 정책을 학습시킵니다. SciVer와 MuSciClaims 데이터셋에서 세 모델 계열(Qwen, InternVL, Gemma)의 다섯 가지 VLM에 대한 실험 결과는, 본 방법론이 프롬프팅 기반 및 RL 기반 도구 사용 방법을 포함한 네 가지 경쟁적인 베이스라인 대비 우수한 성능을 달성했음을 보여주며, 과학적 주장 검증을 위한 학습된 유형 인식 도구 사용의 효과성을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기