CSF: 모션 생성기를 위한 문맥적 안전 필터링
요약
본 논문은 텍스트 조건부 모션 생성기의 한계인 장면 의존적 안전성 문제를 해결하기 위해 '문맥적 안전 필터링(CSF)'을 제안합니다. CSF는 사전 학습이 필요 없는 필터로, 자연어 기반의 안전 규칙을 활용하여 생성된 모션 궤적이 안전한지 위험한지를 판단하고 강제합니다. 이를 통해 위험 이벤트율을 크게 줄이는 동시에 무해한 동작은 높은 비율로 보존할 수 있음을 입증했습니다.
핵심 포인트
- CSF는 훈련 과정이 필요 없는(training-free) 필터입니다.
- 자연어 기반 안전 규칙을 활용하여 모션의 안전성을 검사합니다.
- 위험 이벤트율을 최대 90%까지 줄이는 성능을 보였습니다.
- 실제 로봇(Unitree G1)에 시스템을 시연하며 안전성을 입증했습니다.
텍스트 조건부(Text-conditioned) 모션 생성기는 추적이 가능한 전신 모션을 생성하지만, 장면 의존적인 안전성 개념이 없습니다. 즉, 동일한 동작이라도 객체나 사람을 대상으로 할 수 있습니다. 기존의 안전장치는 프롬프트를 검사하거나, 레이블링된 모션 데이터를 요구하거나, 기하학적 제약을 강제합니다. 따라서 이들은 장면 문맥이 모션의 의미를 어떻게 변화시키는지 직접적으로 고려하지 못합니다. 본 논문에서는 문맥적 안전 필터링(Contextual Safety Filtering, CSF)을 소개합니다. 이는 훈련 과정이 필요 없는(training-free) 필터로, 자연어 기반의 안전 규칙들을 생성기가 만들어낸 안전하고 위험한 참조 궤적에 근거시킵니다. 활성화되는 각 규칙마다, 안전하고 위험한 참조 궤적은 아핀 안전 값(affine safety value)을 정의하며, 이를 안전 참조 추적 CBF-QP가 강제합니다. 서로 다른 아키텍처를 가진 네 개의 사전 학습된 생성기를 통해 CSF는 모든 명시적 및 장면 트리거형의 위험 사례에서 의도한 규칙들을 활성화하고, 위험 이벤트율(danger-event rate)을 최대 90%까지 줄이는 동시에, 무해한 모션의 88~100%를 보존함을 입증합니다. 우리는 실제 Unitree G1 로봇에 이 전체 시스템을 시연했으며, 인간 및 객체와의 상호작용을 포함한 다양한 시나리오에서 안전하지 않은 동작들을 성공적으로 방지했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기