Critical-State RL: 다중 턴 도구 사용을 위한 학습 가능한 상태 진단
요약
본 논문은 다중 턴 도구 사용 시 발생하는 학습 문제를 해결하기 위해 Critical-State RL을 제안합니다. 이 방법은 상호작용 과정에서 행동이 태스크 성공에 미치는 영향을 포착할 수 있는 '학습 가능한 상태'를 식별하고, 이를 기반으로 정책을 최적화하여 성능 향상을 입증했습니다.
핵심 포인트
- Critical-State RL 도입으로 다중 턴 도구 사용의 학습 문제를 해결함.
- 행동 의존적 보상 변화를 분리하기 위해 중첩 샘플링 기법을 활용함.
- 진단된 상태에서 학습하는 것이 대안적인 상태보다 성능 향상을 가져옴 (최대 14%p).
- 제안 방법론은 함수 누락, 인자 누락 등 다양한 모델 및 태스크에 적용 가능함.
다중 턴(Multi-turn) 도구 사용 실패는 단일 모델 호출에 기인할 수 있지만, 보상 변화만으로는 어떤 호출이 학습으로부터 이득을 얻을지 밝혀내기 어렵습니다. 보상이 나중 상호작용에 의존하는 경우, 그 변화는 현재 행동의 차이라기보다는 다운스트림(downstream) 무작위성을 반영할 수 있습니다. 본 논문에서는 Critical-State RL을 도입하여 다중 턴 상호작용에서 학습 가능한 상태를 식별합니다. 주어진 태스크 정의 후보 호출과 지역적 보상을 바탕으로, 이 방법은 각 보상이 행동이 태스크 성공에 미치는 영향을 포착하는지 여부와 참조 정책(reference policy) 대비 개선이 가능한지를 평가합니다. 이후 중첩 샘플링(nested sampling)을 사용하여 행동 의존적 보상 변화를 지속 노이즈(continuation noise)로부터 분리하고, 컨텍스트 기반 밴딧 학습(contextual-bandit training)을 통해 선택된 상태에서 정책을 최적화합니다. Berkeley Function Calling Leaderboard (BFCL) v4에서의 실험은 진단으로 선택된 상태에서 학습하는 것과 대안적인 상태에서 학습하는 것을 비교했습니다. 함수 누락 태스크(missing-function tasks)의 경우, 진단기는 도구가 사용 가능해진 후의 응답을 선택하며, 인자 누락 태스크(missing-argument tasks)의 경우, 누락된 인자가 제공되기 전의 응답을 선택합니다. 선택된 응답을 학습시키는 것이 성능을 개선시키며, 함수 누락 태스크에서 약 14 퍼센트 포인트의 향상을 보인 반면, 대안적인 상태를 학습시키는 것은 성능 변화가 없거나 오히려 저하되었습니다. 나아가 본 방법론을 로그 기록 반복 호출 회피(logged repeat-call avoidance) 및 메모리 관리 등 다양한 모델과 태스크에 적용했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기