CLIFT: 웹 에이전트 학습 및 테스트 시간 스케일링을 위한 공형적 자체 검증
요약
본 논문은 웹 에이전트의 학습 및 테스트 시간을 효율적으로 확장하기 위한 'CLIFT'라는 방법을 제안합니다. CLIFT는 공형적 자체 검증(conformal self-verification)을 기반으로 하며, 에이전트가 롤아웃에 대해 자연어 질문에 답하며 스스로를 검증하는 과정을 거칩니다. 이를 통해 비용이 많이 드는 외부 심사위원의 피드백 없이도 신뢰할 수 있는 학습 및 테스트 평가가 가능해집니다.
핵심 포인트
- CLIFT는 공형적 자체 검증을 활용하여 웹 에이전트의 자가 검증 능력을 강화합니다.
- 훈련 중 자연어 질문 답변과 신뢰 가중치 할당을 통해 효율적인 학습 신호를 생성합니다.
- 테스트 시에는 외부 심사위원 없이도 보수적인 다수결 규칙으로 성능을 평가할 수 있습니다.
- WebArena Infinity 및 VisualWebArena 등 여러 벤치마크에서 최고 성능을 입증했습니다.
오픈 소스 웹 에이전트는 이제 현실적인 브라우저 작업을 실행할 만큼 충분히 강력하지만, 여전히 강화학습(RL)으로 훈련하는 것은 약한 감독에 의존합니다. 이진 작업 성공은 크레딧 할당에는 너무 희소하고, 최첨단 언어 모델 심사위원은 매 단계마다 호출하기에는 비용이 많이 들며 배포 시점에 사용 가능하다고 가정할 수 없습니다. 우리는 공형적 자체 검증(conformal self-verification)을 기반으로 구축된 학습 및 테스트 시간 스케일링 방법인 CLIFT를 소개합니다. 훈련 중, 에이전트는 자신의 롤아웃에 대해 자연어 검증 질문에 답합니다. Compositional Conformal Certifier는 URL 조건부 증거가 훈련 시간 심사위원과 일치하는 질문 신호만 유지하고, 극성 인식 리프팅(polarity-aware lift)을 통해 서명된 신뢰 가중치를 할당하며, 결과적인 검증기 점수를 단계별 보상에 혼합하는데, 이때 심사위원 기준선에서 절대 빼지 않도록 합니다. 테스트 시에는 동일한 인증 은행이 고정되어 Conformal Trajectory Selection (CTS)의 구조화된 증거로 재사용됩니다: 에이전트는 탐욕적인 롤아웃과 하나 이상의 다양한 재시도를 샘플링하고, 자체 검증기가 각 URL 추적을 요약하며, 보수적인 다수결 규칙이 외부 심사위원을 호출하지 않고 현재의 현상 유지(incumbent)에서 벗어날지 여부를 결정합니다. 이 단일 메커니즘은 세 가지 설정에서 지원됩니다. WebArena Infinity에서는 CLIFT가 오픈 소스 웹 에이전트 중 최고 성능을 달성합니다. VisualWebArena에서는 오픈 모델로 훈련된 은행이 테스트 시점에 GPT-5.5로 전송되어 표준 하니스(canonical harness) 하에서 최고 성능에 도달합니다. Online Mind2Web에서는 벤치마크에서 에이전트를 훈련하지 않고도, 인증된 질문 은행을 번역하는 것이 라이브 웹 에이전트의 제로샷 평가를 개선합니다. 이러한 결과들은 공형적 자체 검증이 비용이 많이 드는 심사위원 피드백을 재사용 가능한 학습 신호이자 심사위원 없는 테스트 시간 스케일링 신호로 전환하는 방법임을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기