멀티모달 추론을 위한 오프라인-온라인 커리큘럼 강화학습 (Offline-Online Curriculum RL)
요약
멀티모달 LLM의 추론 과정에서 발생하는 오류를 줄이기 위해 결정적 단계를 인식하는 새로운 커리큘럼 강화학습 프레임워크 $O^2$-CritiCuRL을 제안합니다. 오프라인-온라인 패러다임을 통해 핵심 추론 단계를 추출하고 점진적인 단계별 강화학습을 수행하여 모델의 신뢰성을 높입니다.
핵심 포인트
- 멀티모달 LLM의 중간 추론 단계 결함 및 가짜 지름길 문제 해결
- $O^2$-CritiCuRL 프레임워크를 통한 결정적 단계 인식 도입
- 오프라인 단계의 멀티 롤아웃 분석으로 단계별 중요도 추정
- 온라인 단계의 점진적 강화학습을 통한 추론 과정 개선
- 멀티모달 벤치마크에서 SOTA 성능 및 효율성 달성
멀티모달 거대 언어 모델 (Multimodal large language models)은 추론 작업에서 능력을 보여주지만, 최종 정답을 도출하면서도 중간 단계에서 결함이 있는 과정을 생성하는 경우가 빈번합니다. 이러한 동작은 해석 가능성 (interpretability)과 신뢰성 (reliability)을 저해하며, 충실한 추론보다는 가짜 지름길 (spurious shortcuts)에 의존하고 있음을 시사합니다. 단계별 감독 (step-level supervision)을 탐색하려는 시도들이 있었으나, 결정적인 단계와 불필요한 단계를 구분하는 것은 여전히 어려운 과제로 남아 있습니다. 본 논문에서는 반복적인 오프라인-온라인 패러다임을 통해 결정적 단계 인식 (critical-step awareness)을 도입하는 새로운 커리큘럼 강화학습 (curriculum reinforcement learning) 프레임워크인 $O^2$-CritiCuRL을 제안합니다. 오프라인 단계에서 $O^2$-CritiCuRL은 단계별로 주석이 달린 궤적 (step-annotated trajectories)에 대해 멀티 롤아웃 분석 (multi-rollout analysis)을 수행하여 단계별 중요도를 추정하며, 이를 통해 프레임워크가 핵심 추론 단계를 추출하고 불필요한 단계를 걸러낼 수 있도록 합니다. 온라인 단계에서는 점진적인 단계별 강화학습 (progressive step-level reinforcement learning) 전략을 채택합니다. 여기서 절단된 체인 (truncated chains)은 모델이 누락된 단계를 추론하고 추론 과정을 개선하도록 유도하며, 이를 통해 핵심 단계에 대한 집중도를 높이고 정적인 감독 (static supervision)의 한계를 극복합니다. 멀티모달 추론 벤치마크에 대한 광범위한 실험 결과, 우리의 방법론은 우수한 훈련 및 추론 효율성을 제공하는 동시에 최첨단 (state-of-the-art) 성능을 달성함을 보여줍니다. 코드는 https://github.com/kk0013/CritiCuRL 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기