프롬프트에서 포장도로까지: 에이전트 기반 Scene-to-Plan 추론에서의 시계열적 접지 (Temporal Grounding)
요약
본 연구는 자율 주행 자동차의 장면 해석 및 계획 과정에서 LLM/LMM이 시계열적 맥락을 간과하여 발생하는 추론 불일치 문제를 다룹니다. 연구진은 시계열적 조건화(Temporal Conditioning)를 도입한 세 가지 플래너 아키텍처를 제안하고 BDD-X 데이터셋을 통해 이를 평가했습니다. 실험 결과, 정량적 지표의 큰 개선은 없었으나 질적 분석을 통해 예측적 위험 추론 및 안정적인 교정 동작과 같은 유의미한 행동 변화를 확인했습니다.
핵심 포인트
- 자율 주행 에이전트의 Scene-to-Plan 추론에서 시계열적 접지(Temporal Grounding)의 중요성 강조
- 시계열적 조건화가 표준 NLP 지표에서는 통계적 개선이 미미하나, 질적 측면에서 예측적 위험 추론 및 전략적 분기 유도
- 프롬프트 기반 시계열적 접지의 한계를 규명하고 최초의 시계열적 Scene-to-Plan 경험적 벤치마크 구축
Large Language Models (LLMs) 및 Large Multimodal Models (LMMs)의 앙상블을 사용하여 자율 주행 자동차 (Autonomous Vehicles, AVs)의 고수준 장면 해석 및 계획 (Planning)을 지원하려는 최근의 시도들은 시간을 부차적인 속성으로 계속 취급하고 있습니다. 이러한 시계열적 접지 (Temporal Grounding)의 결여는 연속적인 동작에 대한 추론에서 불일치를 초래하며, 안전성과 해석 가능성 (Interpretability)을 모두 저해합니다. 본 연구는 에이전트 간 통신 내에서의 시계열적 조건화 (Temporal Conditioning)가 의미론적 또는 논리적 일관성의 저하를 일으키지 않으면서 일관성을 유지하거나 향상할 수 있는지 탐구합니다. 이를 조사하기 위해, 우리는 시계열 통합 수준이 점진적으로 증가하는 세 가지 플래너 (Planner) 아키텍처를 도입하고, BDD-X 데이터셋의 선별된 하위 집합을 사용하여 의미론적, 구문론적 및 논리적 지표로 이를 평가합니다. 결과에 따르면, 시계열적 조건화가 추론 스타일을 재형성하기는 하지만, 표준 NLP 기반 정확도 지표에서는 통계적으로 유의미한 개선을 보이지 않았습니다. 그러나 질적 분석을 통해 Sentinel 모델에서 예측적 위험 추론 (Predictive Hazard Reasoning), 안정적인 교정 동작 (Corrective Behavior), 그리고 전략적 분기 (Strategic Divergence)가 나타남을 확인했습니다. 이러한 발견은 프롬프트 기반 시계열적 접지의 한계를 명확히 하며, 시계열적 Scene-to-Plan 추론을 위한 최초의 경험적 벤치마크를 구축합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기