Self-Retrospection Distillation: 사후 경험을 사전 통찰력으로 전환하기
요약
본 논문은 사후 경험에서 얻는 통찰력(hindsight)을 에이전트가 행동하기 전의 예측 능력으로 전환하는 Self-Retrospection Distillation (SRD) 방법을 제안합니다. SRD는 완료된 궤적에서 얻은 유용한 지식을 정책에 구애받지 않는 사전 통찰력으로 증류하여, 특히 보상 대비가 부족한 복잡한 강화학습 환경에서 에이전트의 성능을 크게 향상시킵니다.
핵심 포인트
- SRD는 사후 경험(hindsight)을 사전 예측 능력(foresight)으로 전환합니다.
- 보상이 균일하거나 부족한 상황에서 특히 효과적입니다.
- RLVR과 결합하여 장기 지평 에이전트 과제에서 높은 성능 향상을 보였습니다.
검증 가능한 보상을 이용한 강화학습 (RLVR)은 에이전트의 경험을 주로 상호작용 후 스칼라 결과 보상(scalar outcome rewards)을 통해 학습 신호로 변환합니다. 하지만 그룹 상대적 목표(group-relative objectives)의 경우, 모든 롤아웃(rollouts)이 동일한 보상을 받을 때 이 신호가 사라지며, 비록 그들의 궤적(trajectories)이 과제가 무엇을 요구하는지 그리고 에이전트가 어떻게 실패했는지에 대한 유용한 정보를 드러낼 수 있음에도 불구하고 그렇습니다. 우리는 상보적인 질문을 던집니다: 사후 통찰력(hindsight)이 에이전트가 행동하기 전에 무엇을 예상할 수 있었는지 가르칠 수 있을까? 우리는 사후 경험을 사용하여 사전 상호작용 뷰(pre-interaction view)에서의 통찰 예측(foresight predictions)을 감독하는 전망적 학습(prospective learning)을 도입하고, 이를 Self-Retrospection Distillation (SRD)으로 구현합니다. 직관적으로, 완료된 궤적은 유용했을 지식과 피해야 할 함정을 드러내며; SRD는 이 특권적인 사후 통찰력(privileged hindsight)을 동일한 정책의 궤적에 구애받지 않는 통찰력(trajectory-blind foresight)으로 증류합니다. 통찰력은 단지 학습 목표일 뿐이며 추론 시간(inference time)에 명시적으로 생성될 필요는 없습니다. 10가지 도구 통합 추론 및 장기 지평 에이전트 과제 전반에 걸쳐, SRD는 RLVR 및 자체 증류 기반 모델을 보완하여 최대 $24.2$ pp의 이득을 얻었습니다. 그 장점은 특히 보상 대비가 부족할 때 두드러집니다: 롤아웃 그룹의 $37$--$98$%가 모델 스케일 전반에 걸쳐 보상이 균일할 때에도, SRD는 여전히 샘플링된 궤적에서 학습 신호를 활용할 수 있습니다. $98$%의 그룹이 모두 실패하는 $2B$ 설정에서는 RLVR 학습이 $0.0$% 성공률로 끝나지만, SRD를 추가하면 동일한 롤아웃 예산 하에 $60.6$%에 도달합니다. 우리의 결과는 사후 에이전트 경험이 단순히 행동을 평가하거나 개선하는 데 유용할 뿐만 아니라, 사용 가능한 상호작용 이전에 예측 표현(predictive representations)을 형성하는 데에도 유용함을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기