작업 결과로부터 LLM 에이전트를 위한 어드바이저 훈련
요약
본 논문은 LLM 에이전트의 성능 향상을 위해 'Caddie'라는 비평가(critic) 훈련 방법을 제안합니다. Caddie는 작업 진행 중 자연어 분석과 조언을 제공하는 비평가를, 최종 성공 여부로부터 학습하도록 강화학습으로 최적화합니다. 이 방법은 다양한 기본 모델에 적용 가능하며, MuSiQue 벤치마크에서 기존 대비 높은 성능 향상을 입증했습니다.
핵심 포인트
- Caddie는 에이전트의 최종 성공 여부를 통해 비평가를 훈련시킵니다.
- 강화학습(RL)을 사용하여 비평가 모델을 최적화합니다.
- 다양한 기본 모델에 걸쳐 전이 가능한 안내를 생성할 수 있습니다.
- MuSiQue 벤치마크에서 기존 대비 높은 성공률 향상을 보였습니다.
대규모 언어 모델(LLM) 에이전트는 추론과 도구 호출을 환경으로부터의 관찰과 번갈아 가며 다단계 작업을 수행합니다. 이전 연구에서는 자연어 피드백이 이러한 에이전트가 작업 실행 중에 결정을 수정하는 데 도움을 줄 수 있음을 보여주었습니다. 우리는 Caddie를 소개합니다. 이는 에이전트가 작업을 진행하는 동안 자연어 분석과 조언을 제공하도록 비평가(critic)를 훈련시키는 방법입니다. 단계별 레이블이나 참조 비평에 의존하는 접근 방식과 달리, Caddie는 비평가의 피드백을 받은 후 에이전트가 궁극적으로 성공했는지 여부로부터 학습합니다. 우리는 기본 모델을 고정한 상태로 강화학습(RL)을 통해 비평가를 최적화합니다. 단일 기본 모델로 다중 홉 질문 답변에 대해 훈련된 우리의 Qwen3-4B 비평가는 비평가 훈련 중 사용되지 않은 세 가지를 포함하여 다양한 규모와 아키텍처의 네 가지 기본 모델 전반에 걸쳐 성공률을 향상시킵니다. MuSiQue 벤치마크에서, 훈련된 비평가는 Qwen3-4B의 성공률을 25 퍼센트 포인트 이상 향상시켜 비평가 없이 Kimi K3의 성능을 능가합니다. 동일한 비평가는 추가적인 훈련 없이 $ au^3$ 및 DeepDive를 포함한 도메인 외부 상호작용 벤치마크에서도 이득을 제공합니다. 우리의 결과는 에이전트가 추론 시점에 언제 비평가로부터 도움을 요청할지 결정할 수 있으며, 결과 기반의 비평가 훈련이 기본 모델과 작업 도메인 전반에 걸쳐 전이되는 안내를 생성할 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기