CoWAM: WAMs를 활용한 선택적 정책 개입을 위한 조정 계약 (Coordination Contracts)
요약
CoWAM은 World Action Models(WAMs)를 활용하여 로봇의 양손 작업 시 선택적 정책 개입을 수행하는 새로운 프레임워크를 제안합니다. 조정 계약(Coordination Contracts)을 통해 동기화와 충돌 방지를 검증하며, 안전하고 효과적인 행동 수정을 목표로 합니다.
핵심 포인트
- 조정 계약을 통한 동기화 및 역할 호환성 검증
- 명목상 행동 유지 및 저위험 개선 시에만 개입
- 양손 작업 시 조정 유효 선택률 16.7%p 향상
- 유해한 개입을 1% 미만으로 유지하며 성공률 개선
World Action Models (WAMs)는 행동 조건부 예측 미래(action-conditioned predicted futures)를 통해 로봇 정책을 증강하지만, 그저 그럴듯한 미래를 예측하는 것만으로는 양손(bimanual) 정책이 실행하려는 행동을 변경하는 것을 정당화할 수 없습니다. 본 논문에서는 동기화(synchronization), 역할 호환성(role compatibility), 충돌 수렴(collision convergence)을 조정 계약(coordination contracts)으로 표현하는 선택적 개입 계층인 CoWAM을 제시합니다. 각 계약은 유형별 허용성 검사(typed admissibility checks)를 이벤트 조건부 검증(event-conditioned verification) 및 보정된 개입 게이트(calibrated intervention gates)와 결합합니다. CoWAM은 대안이 모든 활성 의무(active obligation)를 충족하고 명확하며 저위험의 개선을 제공하지 않는 한 명목상 행동(nominal action)을 유지하며, 명목상 행동 또한 허용되지 않는 경우에는 미리 정의된 기권 폴백(abstention fallback)을 호출합니다. 선택기 품질(selector quality)과 제안 품질(proposal quality)을 분리하기 위해, 모든 방법은 동일한 후보 풀(candidate pools)에서 작동하며 공유된 오라클 레이블링(shared oracle labeling) 이전에 결정을 확정합니다. 8가지의 시뮬레이션된 양손 작업 전반에 걸쳐, CoWAM은 계약 전용 변형(contract-only variant) 대비 조정 유효 선택(coordination-valid selection)을 16.7%포인트 향상시켰으며, 가장 강력한 선택적 베이스라인(selective baseline) 대비 폐루프 성공률(closed-loop success)을 9.6%포인트 높이는 동시에 유해한 개입(harmful interventions)을 1% 미만으로 유지했습니다. 이러한 결과들을 종합하면, 조정 계약이 조정이 풍부한 양손 작업 전반에서 예측된 세계-행동 증거(world-action evidence)를 바탕으로 보수적인 정책 개입을 수행하기 위한 효과적인 인터페이스임을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기