
DEFT-RLVR: 자율 주행 VLM을 위한 검증 가능한 추론
요약
자율 주행 VLM의 환각 현상을 줄이기 위해 제안된 DEFT-RLVR 연구를 소개합니다. 기존 CoT 방식의 문제점을 해결하기 위해 계획 과정을 다지선다형 궤적 선택 방식으로 재구성하여 성능을 개선했습니다.
핵심 포인트
- 자율 주행 VLM의 CoT 학습 시 발생하는 환각 문제 해결
- 계획 과정을 다지선다형 궤적 선택 방식으로 재구성
- 환각 발생률을 기존 50%에서 29%로 대폭 감소
자율 주행 VLM (Vision-Language Models)은 기존의 CoT (Chain-of-Thought) 학습이 정답인 미래 궤적 (ground-truth future trajectory)을 노출하기 때문에 종종 환각 (hallucination) 현상을 일으킵니다. DEFT-RLVR은 이러한 노출을 지연시키고, 계획 (planning)을 다지선다형 궤적 선택 (multiple-choice trajectory selection)으로 재구성하여 환각 발생률을 50%에서 29%로 낮춥니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기