AdviSD: 목표 지향적 다중 턴 자가 증류를 통한 최전선 LLM 조언 학습
요약
AdviSD는 결과 기반 강화학습과 자가 증류를 결합한 새로운 방법론입니다. 이 방법은 피드백을 통해 어드바이저의 조언을 개선하며, 특히 어떤 수정(correction)이 다른 수정보다 더 유용한지 선택적으로 학습하여 모델 성능을 향상시킵니다. Gemini와 Claude 환경에서 Qwen3-8B를 사용한 실험 결과, 기존 방식 대비 높은 성능 향상을 입증했습니다.
핵심 포인트
- AdviSD는 강화학습과 자가 증류를 결합한 방법론입니다.
- 피드백 기반으로 어드바이저의 조언을 선택적으로 개선합니다.
- 실행기 롤아웃이나 가능도 계산이 필요 없어 효율적입니다.
- Gemini, Claude 등 다양한 환경에서 높은 성능 일반화 능력을 보였습니다.
작은 학습 가능한 어드바이저(advisor)는 자연어 조언을 사용하여 고정된 언어 모델 실행기(language-model executor)를 유도할 수 있습니다. 어드바이저는 작업 보상(task rewards)으로부터 학습하는 것 외에도, 완료된 상호 작용에서 피드백을 사용하여 자신의 조언을 개선할 수 있습니다. 하지만 그럴듯한 수정(correction)이 반드시 실행 자체를 변경할 필요는 없지만, 이러한 수정으로부터의 학습은 여전히 다른 맥락에서의 어드바이저의 미래 결정에 영향을 미칠 수 있습니다. 공유 파라미터 모델에서, 우리는 그러한 수정들이 그 목표가 다른 수정들의 목표보다 유용한 조언을 덜 선호하는 경우 학습을 제한할 수 있음을 증명합니다. 이러한 수정들을 나머지들보다 덜 자주 사용하는 것이 모든 수정으로부터 학습하는 것과 비교하여 모델의 최종 성능을 향상시킵니다. 이에 동기를 부여받아, 우리의 방법인 Advisor Self-Distillation (AdviSD)은 결과 기반 강화학습(outcome-based reinforcement learning)을 어드바이저의 피드백 조건부 복사본으로부터 선택적으로 자가 증류(self-distillation)와 결합합니다. Reflection이 수정을 제안하고, 어드바이저는 자신이 발행한 조언 유무에 따라 동일하게 기록된 실행기 응답 점수를 매기고, 그 차이의 크기를 사용하여 지도 학습을 위한 결정을 선택합니다. 이 접근 방식은 실행기의 가능도(executor likelihoods)나 추가적인 실행기 롤아웃(executor rollouts)을 필요로 하지 않습니다. Gemini와 Claude를 위한 Qwen3-8B 어드바이저를 사용한 실험에서 AdviSD는 BFCL-v3에서 advisor-GRPO보다 4.26.4 퍼센트 포인트, EnvScaler에서는 3.95.1 점 포인트 더 높은 성능을 보였습니다. 학습된 어드바이저는 도메인 외부 작업에 일반화되며 다양한 실행기 버전 및 모델 패밀리 전반으로 전이됩니다. AdviSD는 또한 매치드 카운트 무작위 선택(matched-count random selection)보다 우수하여, 그 선택 규칙의 가치를 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기