ABSeeker: 정답 역추적 신용 할당(Answer-Backtracked Credit Assignment)을 통한 장기 탐색 에이전트 학습
요약
장기 탐색 에이전트 학습을 위해 정답에서 역추적하여 중간 단서를 복구하고, 각 단계의 유용성을 평가하는 ABC 프레임워크를 제안합니다. 이를 통해 희소한 결과를 조밀한 단계별 보상으로 변환하여 에이전트의 성능을 극대화합니다.
핵심 포인트
- 정답 역추적을 통한 단계별 신용 할당(ABC) 프레임워크 제안
- 유용한 행동에는 보상을, 오류나 중복 행동은 억제하는 조밀한 감독 가능
- ABC-SFT 및 ABC-GRPO를 통해 학습 효율성 및 성능 개선
- 4B 규모의 ABSeeker가 30B 규모의 에이전트와 대등한 성능 달성
장기 탐색 에이전트(Long-horizon search agents)는 최종 답변에 도달하기 위해 검색, 검색(retrieve), 검증 및 증거 통합을 수행하는 여러 순차적 행동(단계)을 수행해야 합니다. 그러나 이러한 에이전트를 학습시키는 기존 방법들은 일반적으로 지도 미세 조정(SFT) 및 강화 학습(RL) 과정에서 궤적(trajectory) 내의 모든 단계를 균일하게 취급하며, 유용한 행동과 오류가 있거나 중복된 행동을 구분하지 못합니다. 본 논문에서는 희소한 궤적 수준의 결과를 유용한 행동에는 보상을 주고(실패한 궤적에서도) 오류가 있거나 중복된 행동은 억제하는 조밀한 단계 수준의 감독으로 변환함으로써, 장기 탐색 에이전트를 학습시키기 위한 미세한 신용 할당(credit assignment) 프레임워크인 정답 역추적 신용 할당(Answer-Backtracked Credit Assignment, ABC)을 제안합니다. 구체적으로, 잠재적으로 모호한 질의와 그에 상응하는 정답(ground-truth answer)이 주어지면, ABC는 먼저 정답에서 역추적하여 질문을 해결하는 데 필요한 중간 단서들을 복구하는 정답 역추적 단서 복구(Answer-Backtracked Clue Recovery)를 수행합니다. 그런 다음 단서 고정 단계 점수 산정(Clue-Anchored Step Scoring)을 적용하여 각 검색 단계를 이러한 단서들과 비교 평가함으로써, 희소한 이진 결과 감독을 조밀한 단계 수준의 보상으로 변환합니다. 이러한 보상을 바탕으로, 우리는 각 턴의 손실(loss) 가중치를 재조정하는 ABC-SFT와 단계 수준의 점수를 GRPO의 보상으로 사용하는 ABC-GRPO를 개발합니다. 이 프레임워크를 기반으로, 우리는 단 8.5k개의 예시만을 사용하여 Qwen3.5-4B를 기반으로 한 ABSeeker를 학습시킵니다. ABSeeker는 BrowseComp에서 37.3%, BrowseComp-ZH에서 39.1%를 달성했습니다. 문맥 관리(context management)를 통해 점수는 각각 55.3%와 52.9%로 더욱 향상되었으며, 이는 동일 규모(4B)의 에이전트를 크게 능가하고 더 큰 규모(약 30B)의 에이전트 성능과도 대등한 수준입니다. 이러한 결과는 장기 탐색 에이전트 학습을 위한 정답 역추적 단계 수준 신용 할당의 효과를 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기