라마르크의 운전 학원: 진화적 경쟁을 통한 자율주행 훈련 전략 발견
요약
본 논문은 자율주행 훈련 시나리오 분포 구성의 비효율성을 해결하기 위해 라마르크적 진화 프레임워크를 제안합니다. 이 방법론은 다윈적 교차, 돌연변이, 선택을 통해 시나리오 공간을 탐색하고, 정책 학습과 라마르크적 유전 메커니즘을 결합하여 시나리오 분포와 정책 능력이 공동 진화하도록 합니다. 그 결과, 단계별 도전 순환을 통한 능력 축적 패턴을 발견했습니다.
핵심 포인트
- 대리 기준 기반 훈련의 비효율성을 개선하는 라마르크적 접근법 제시
- 다윈적 탐색과 라마르크적 유전이 결합된 공동 진화 프레임워크 구축
- 단계별 도전 순환을 통해 능력 축적 패턴 및 재사용 가능한 전략 발견
- 기존 대비 최대 25.07%의 성능 손실 감소 효과 입증
자율주행 능력은 훈련 과정에서 접하는 시나리오 분포에 크게 의존합니다. 기존 방법들은 현실성, 난이도, 위험도와 같은 대리 기준(surrogate criteria)을 사용하여 훈련 시나리오 분포를 구성하거나 동적으로 적응시킵니다. 하지만 이러한 사전 정의된 대리 기준은 훈련 가치를 잘못 표현할 수 있어 훈련 자원의 비효율적인 사용으로 이어집니다. 이 한계를 해결하기 위해, 우리는 대리 기반의 안내(guidance)를 후보 분포 간의 경쟁으로 대체하는 라마르크적 진화 프레임워크를 제안합니다. 우리는 훈련 전략 발견을 다단계 이중 레벨 최적화 문제로 공식화하고, 라마르크적 진화 알고리즘(Lamarckian evolution algorithm)을 사용하여 그 해답을 근사합니다. 외부 레벨에서는 다윈적 교차(Darwinian crossover), 돌연변이(mutation), 선택(selection)이 시나리오 분포 공간을 탐색하며; 내부 레벨에서는 정책 학습(policy learning)이 새로운 능력을 습득하고, 라마르크적 유전(Lamarckian inheritance)이 이를 후속 단계로 전달하여, 시나리오 분포와 정책 능력이 공동 진화하도록 합니다. 그 결과 얻어진 진화 궤적은 높은 가치를 지닌 분포들 사이의 반복적인 단계별 규칙성(stage-wise regularities)을 드러내며, 이는 단계별 도전 순환을 통한 능력 축적으로 특징지어집니다. 나아가 우리는 이러한 규칙성을 경량화되고 재사용 가능한 라마르크적 훈련 전략으로 정제합니다. 실험 결과에 따르면, 이 전체 프레임워크는 기준선(baseline) 대비 최대 25.07%의 성능 손실을 줄이는 것으로 나타났으며, 경량화된 전략만으로도 19.13%의 감소를 달성했습니다. 이러한 결과들은 진화적 경쟁이 효과적인 훈련 전략을 발견할 뿐만 아니라, 정책 능력이 변화함에 따라 훈련 분포의 가치가 어떻게 변하는지에 대한 재사용 가능한 단계별 패턴을 밝혀낼 수 있음을 입증합니다. 코드는 GitHub에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기