DreamTest: 심층 강화학습 에이전트의 검색 기반 테스트를 위한 월드 모델 대리(Surrogate)
요약
DreamTest는 심층 강화학습(DRL) 에이전트의 테스트 비용을 줄이기 위해 월드 모델 대리(Surrogate)를 제안합니다. 이 방법은 단순히 실패 여부를 예측하는 것을 넘어, 상상된 롤아웃을 통해 에피소드를 전개하며 실패를 추정합니다. 이를 통해 실제 시스템에서 모든 테스트를 실행하지 않고도 효과적으로 검색할 수 있습니다.
핵심 포인트
- DreamTest는 DRL 에이전트의 테스트 비용 절감을 목표로 합니다.
- 상상된 롤아웃을 사용하여 실패 가능성을 예측하고 테스트를 안내합니다.
- 주차장, 휴머노이드 등 다양한 환경에서 높은 성능을 입증했습니다.
- 실제 시스템 대비 더 많은 새로운 실패 사례를 발견하는 능력을 보여줍니다.
사이버-물리 시스템에서 심층 강화학습 (DRL) 에이전트를 테스트하는 것은 배포 전에 다양한 실패 사례를 발견하는 것을 목표로 하지만, 각 실행은 비용이 많이 듭니다. 대리(Surrogate)-지원 테스트는 어떤 테스트 구성이 실패할 가능성이 높은지 예측하도록 학습함으로써 이러한 비용을 줄입니다. 이전의 대리는 시스템을 블랙박스로 취급하고 통과 또는 실패 결과를 직접 예측합니다. 반면, 우리는 테스트가 어떻게 전개되는지를 모델링하고 상상된 에피소드로부터 실패를 추정하는 방법을 제시합니다. 우리는 DRL 에이전트 테스트를 위한 월드 모델 대리인 DreamTest를 소개합니다. DreamTest는 재귀적 상태 공간 모델(recurrent state-space model)을 적응시켜 에이전트의 훈련 로그로부터 에이전트 행동과 환경 역학을 학습합니다. 주어진 후보 구성에 대해, 상상된 롤아웃(imagined rollouts)은 실패 점수를 생성하여 시뮬레이터나 실제 시스템에서 모든 후보를 실행하지 않고도 검색을 안내합니다. 우리는 주차장 (Parking), 휴머노이드 (Humanoid), 그리고 DonkeyCar에 대해 DreamTest를 실패 예측, 테스트 생성, 및 실패 다양성 측면에서 평가했습니다. 평균 정밀도-재현율 곡선 아래 면적 (AUPRC)은 각각 가장 강력한 기준선 대비 97%, 12%, 39%를 초과했으며, 오분포(out-of-distribution) 테스트 세트 다섯 개에서 얻은 이득은 각각 145%, 29%, 44%에 달했습니다. 동일한 시뮬레이터-검증 예산 하에서, 최고의 "DreamTest + 검색" 조합은 평균적으로 29%, 22%, 79% 더 많은 새로운 실패 사례를 발견했습니다. k = 2-40의 클러스터링 전반에 걸쳐, DreamTest로 생성된 실패는 거의 모든 k에 대해 가장 많은 행동적 클러스터를 커버하며, 이는 DreamTest가 일관되게 행동적으로 다양한 실패 사례를 발견함을 나타냅니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기