임시 팀워크(Ad-Hoc Teamwork)에서의 태스크 불가지론적 적응을 위한 파트너 능력 추정
요약
자율 에이전트가 파트너의 숨겨진 능력을 추정하여 임시 팀워크(AHT) 환경에서 효과적으로 협업할 수 있도록 돕는 CE-CM 방법론을 제안합니다. 이 방식은 태스크 불가지론적 능력 벡터를 추론하여 멀티 태스크 환경에서도 온라인으로 신념을 정교화하며, 인간의 행동 다양성을 고려한 CE-CM-Div를 통해 협업 성능을 높였습니다.
핵심 포인트
- 파트너의 숨겨진 능력을 추정하는 근사 베이지안 방법론 CE-CM 소개
- 태스크 불가지론적(task-invariant) 능력 벡터 추론을 통한 멀티 태스크 확장
- 인간의 예측 불가능성을 반영한 CE-CM-Div 모델 제안
- 시뮬레이션 및 인간 연구를 통해 능력 추정 및 적응력 입증
새롭고 다양한 파트너와의 효과적인 협업은 자율 에이전트(autonomous agents)에게 매우 중요한 기술입니다. 현재 대부분의 임시 팀워크 (Ad-Hoc Teamwork, AHT) 접근 방식은 에이전트가 단일하고 고정된 태스크에서 협업할 것이며, 파트너의 능력(원하는 행동을 성공적으로 수행하는 능력)이 이미 알려져 있다고 가정합니다. 실제로 파트너의 진정한 능력은 종종 숨겨져 있으며, 인간 협업자는 여러 가지 유효한 전략이 존재하는 태스크에서 최적화되지 않은 방식으로 행동할 수 있습니다. 이러한 한계를 해결하기 위해, 우리는 숨겨진 파트너 능력 하에서 분산 실행(decentralised execution)을 동반한 공동 계획(joint planning) 문제로 재구성함으로써 임시 팀워크를 멀티 태스크(multi-task) 환경으로 확장합니다. 우리는 태스크 불가지론적(task-invariant) 능력 벡터를 추론하는 근사 베이지안(approximate Bayesian) 방법인 CE-CM (Capability Estimation via Contextual Models)을 소개합니다. 시뮬레이션 기반 샘플링(simulation-based sampling)을 사용하여, 에이전트는 능력을 추정하고 계획을 위한 문맥적 다중 에이전트 마르코프 결정 과정 (contextual Multi-agent Markov Decision Processes)을 유도합니다. 이 접근 방식은 모집단 사전 학습 (population pre-training)을 필요로 하지 않으며, 단 몇 개의 태스크만으로 온라인에서 신념(beliefs)을 정교화합니다. 인간의 예측 불가능성을 고려하기 위해, 우리는 단일 최적 궤적(optimal trajectory) 대신 다양한 플래너 롤아웃(planner rollouts)에 대해 능력 가설을 평가하는 확장 방식인 CE-CM-Div를 제안합니다. 시뮬레이션 실험을 통해 CE-CM이 숨겨진 능력을 빠르게 회복하고, 실행 불가능한 행동 할당을 줄이며, 시간에 따른 변화에 적응함을 입증했습니다. 또한, 15명의 참가자로부터 얻은 225개의 궤적을 대상으로 한 오프라인 인간 연구에서, CE-CM-Div는 베이스라인인 CE-CM 방법보다 능력 추정치를 실질적으로 향상시켰습니다. 우리의 결과는 능력 기반 모델링이 연구된 환경에서 유망하고 해석 가능한 태스크 불가지론적 표현임을 시사하며, 행동적 다양성(behavioural diversity)을 고려하는 것이 강건한 인간-AI 팀 구성(human-AI teaming)에 필수적임을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기