LLM-as-a-Coach: 검증 불가능한 작업(Non-Verifiable Tasks)을 위한 경험적 학습 (Experiential
요약
개방형 작업에서 스칼라 보상 대신 풍부한 텍스트 피드백을 활용하는 'LLM-as-a-Coach' 기반의 경험적 학습(EL) 방식을 제안합니다. 이 방식은 고품질 응답 간의 미세한 차이를 보존하여 기존 루브릭 기반 강화학습보다 우수한 일반화 성능을 보입니다.
핵심 포인트
- 스칼라 보상의 정보 손실 문제를 해결하기 위해 텍스트 피드백을 활용한 경험적 학습 제안
- 교사 모델의 평가를 경험적 지식으로 증류하여 정책에 내재화하는 방식 도입
- 기존 루브릭 기반 RL 대비 높은 일반화 성능 및 보상 해킹 완화 효과 입증
- 검증 불가능한 작업의 사후 학습을 위한 풍부한 학습 신호 제공
개방형 작업(open-ended tasks)에서의 강화학습 (RL)은 LLM의 루브릭 기반 평가를 스칼라 보상(scalar reward)으로 압축하며, 이 과정에서 풍부한 텍스트 피드백을 버리고 서로 다른 품질 프로필을 가진 응답들을 하나로 뭉뚱그려 버립니다. 우리는 LLM-as-a-Judge의 피드백 모델을 LLM-as-a-Coach로 재용도화하는 경험적 학습 (Experiential Learning, EL)을 제안합니다. 이 코치는 각 온폴리시 (on-policy) 응답에 대한 자신의 평가를 전이 가능한 경험적 지식 (experiential knowledge)으로 증류하며, 이는 교사 모델 (teacher model)을 조건화하고 온폴리시 컨텍스트 증류 (on-policy context distillation)를 통해 정책 (policy)에 내재화됩니다. 스칼라 보상과 비교했을 때, 이 더 높은 대역폭의 피드백 채널은 조밀한 감독 (dense supervision)을 제공하며 고품질 응답들 사이의 미세한 선호도를 보존합니다. 정책 자체 또는 독점 모델 (proprietary model)로부터 얻은 피드백을 사용한 두 가지 정책 계열(policy families)에 대해, EL은 홀드아웃 (held-out) 및 미학습된 개방형 작업에서 루브릭 기반 RL보다 일관되게 우수한 성능을 보였습니다. 특히, EL은 훈련 분포를 넘어 더 잘 일반화되며 보상 해킹 (reward hacking)을 완화합니다. 이러한 발견은 경험적 지식이 검증 불가능한 작업의 사후 학습 (post-training)을 위한 더 풍부하고 일반화 가능한 학습 신호임을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기