ENCP: 비전-언어 내비게이션을 위한 에피소드 정규화 컨포멀 예측
요약
본 논문은 비전-언어 내비게이션(VLN) 모델의 불확실성 추정 문제를 다루며, 에피소드 정규화 컨포멀 예측(ENCP)이라는 새로운 프레임워크를 제안합니다. ENCP는 의존적이고 가변 길이인 VLN 에피소드에 걸쳐 신뢰할 수 있는 커버리지 보장을 제공하여, 에이전트가 안전한 내비게이션 결정을 내릴 수 있도록 돕습니다.
핵심 포인트
- ENCP는 VLN의 불확실성 추정에 유용한 새로운 접근 방식입니다.
- 표준 컨포멀 예측의 한계를 극복하고 가변 길이 에피소드에 적용 가능합니다.
- 모델에 구애받지 않는(model-agnostic) 방식으로 신뢰도 높은 커버리지를 보장합니다.
비전-언어 내비게이션(VLN) 모델의 불확실성 추정은 모호하고 신뢰할 수 없는 예측을 식별하는 데 도움을 줄 수 있어, 에이전트가 더 안전한 내비게이션 결정을 내릴 수 있게 하므로 매우 중요한 작업입니다. 가장 진보된 불확실성 추정 프레임워크 중 하나인 컨포멀 예측(CP)은 VLN의 불확실성 추정에 유망한 접근 방식을 제공합니다. 그러나 VLN 에이전트가 일련의 단계를 필요로 한다는 점을 고려할 때, 컨포멀 예측의 표준 보정(standard calibration) 방식으로는 의존적이고 가변 길이인 VLN 에피소드에 걸쳐 약속하는 커버리지 보장(coverage guarantee)을 제공하지 못합니다. 이를 위해, 우리는 에피소드 정규화 컨포멀 예측(ENCP, Episode-Normalized Conformal Prediction)을 제안하며, 이는 정책의 잔여 신뢰도(residual confidence)로 비컨포름성 점수(nonconformity score)를 재조정하고 에피소드당 최대 하나의 점수를 보정합니다. 교환 가능한(exchangeable) 보정과 테스트 에피소드를 통해, 이 구성은 에피소드 내 단계들 간의 의존성을 허용하면서도 모든 단계에서 참값(ground truth)을 최소 $1 - \alpha$ 확률로 커버합니다. R2R 및 REVERIE 데이터셋에서 네 가지 VLN 정책과 세 가지 비컨포름성 점수를 사용한 테스트 전반에 걸쳐, ENCP는 관찰된-관찰되지 않은 평가(seen-to-unseen evaluation)에서 보고된 모든 경험적 단계 커버리지 목표를 충족합니다. 이러한 결과들은 ENCP가 모델에 구애받지 않는(model-agnostic) 불확실성 추정치를 제공할 수 있음을 입증하며, 이는 VLN 에이전트가 언제 더 유능한 예측기(예: 인간의 도움)에게 위임해야 하는지를 결정하는 데 유용할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기