AdvSim2Real: 웹 환경 모델에서 적응형 프롬프트 주입에 대비한 웹 에이전트 학습
요약
본 논문은 웹 환경에서 외부 지침에 의해 에이전트의 목표가 왜곡되는 문제를 다룹니다. AdvSim2Real이라는 새로운 학습 프레임워크를 제안하며, 이는 작업 커리큘럼, 주입 적대자, 그리고 에이전트를 동시에 진화시키는 방식으로 훈련합니다. 이 방법을 통해 에이전트는 실제 환경에서 높은 견고성과 완료율을 보입니다.
핵심 포인트
- AdvSim2Real은 웹 에이전트의 목표 왜곡 문제를 해결하는 프레임워크이다.
- 작업 커리큘럼, 주입 적대자, 에이전트를 동시에 진화시켜 훈련한다.
- 에이전트는 공격 여부와 관계없이 높은 완료율과 견고성을 확보한다.
- 실제 브라우저 환경으로의 성능 전이가 입증되었다.
웹 에이전트는 제3자가 작성한 페이지를 읽고 그 내용을 기반으로 행동하여 사용자 요청을 완료합니다. 따라서 페이지에 심어진 지침은 에이전트를 사용자의 목표에서 벗어나게 할 수 있습니다. 에이전트는 해당 페이지를 무시할 수 없습니다. 왜냐하면 이 페이지가 작업 수행에 필요한 값들을 담고 있고 작업을 제어하기 때문입니다. 현재의 방어 기법들은 훈련 전에 고정된 주입 공격(injection)을 기반으로 에이전트를 미세 조정하지만, 이에 적응하는 공격자들은 이를 우회합니다. 적대적 학습(Adversarial training)은 공격자가 적응하도록 하지만 작업 자체는 고정하기 때문에, 에이전트가 작업을 해결하면 그 작업에 대한 학습이 멈춥니다. 우리는 AdvSim2Real을 소개합니다. 이는 동결된 웹 환경 모델 내부에서 작업 커리큘럼, 주입 적대자(injection adversary), 그리고 에이전트를 함께 진화시키는 방식입니다. 이 커리큘럼은 에이전트가 약 절반 정도의 확률로 해결하는 작업을 통해 보상을 받고, 적대자는 오직 성공을 실패로 뒤집는 주입 공격(success flip)에 대해서만 보상을 받습니다. 시뮬레이터에서의 훈련은 4B 규모의 에이전트를 더 유능하고 더 견고하게 만듭니다. 이 에이전트는 공격 여부와 관계없이 완료율이 상승하며, 한 번도 훈련하지 않은 최첨단 모델 수준의 적대자에게도 버틸 수 있고, 그 능력 향상이 실제 브라우저로까지 전이됩니다. 150개의 웹 작업에 대해 AdvSim2Real은 이 보지 못한 적대자에 대비하여 기본 에이전트 대비 완료율을 33.6% 높입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기