RewardExplainer: 반사실적 선호도 피드백으로부터 보상 모델 설명 학습
요약
본 논문은 LLM 후속 훈련의 핵심인 보상 모델(RM)의 한계를 극복하기 위해 RewardExplainer 프레임워크를 제안합니다. 이 프레임워크는 반사실적 재작성을 통해 RM으로부터 피드백을 얻고, 이를 설명기 최적화에 활용하여 점수 결정 과정을 구체적이고 실행 가능하게 만듭니다.
핵심 포인트
- RewardExplainer: 보상 모델의 작동 원리를 설명하는 새로운 프레임워크 제시
- 반사실적 재작성(counterfactual rewriting)을 통해 RM으로부터 풍부한 피드백 획득
- 설명기를 추가 최적화하여 점수 결정 과정을 구체적이고 읽기 쉽게 만듦
- 편향 패턴 식별 및 디바이어싱 데이터 구성으로 모델 강건성 향상
보상 모델(RMs)은 대규모 언어 모델(LLM)의 후속 훈련에서 핵심 구성 요소이며, 이후 강화학습(RL)을 위한 보상 신호를 제공합니다. 하지만 기존의 판별적(discriminative) RM들은 일반적으로 스칼라 점수만 출력하여, 그들의 점수 결정과 관련된 응답 행동을 식별하기 어렵게 만듭니다. 기존 해석 방법은 종종 미리 정의된 고수준 속성에 의존하며, 후보 설명(explanation)을 검증하기 위해 각 응답 쌍에 대한 반복적인 반사실적 개입(counterfactual interventions)이 필요하여, RM의 피드백을 사용하여 재사용 가능한 설명기(explainer)를 훈련하는 폐쇄 루프 메커니즘이 부족합니다. 이를 해결하기 위해, 우리는 RewardExplainer라는 프레임워크를 제안하며, 이는 반사실적 재작성(counterfactual rewriting)을 통해 대상 보상 모델로부터 피드백을 얻고 이 피드백을 사용하여 설명기를 추가로 최적화합니다. RewardExplainer는 개방형(open-ended), 원자적(atomic), 그리고 개입 가능한 자연어 점수 메커니즘을 생성하여, 설명을 더욱 구체적이고 읽기 쉬우며 실행 가능하게 만듭니다. 또한 반사실적 피드백을 선호도 감독(preference supervision)으로 변환하여, 설명기가 단일 통과 생성보다 대상 RM의 점수 선호도와 민감한 행동을 더 충실하게 포착하도록 합니다. 여러 대상 RM 및 설명기 백본에 걸친 광범위한 실험은 일관된 개선을 보여줍니다. 해석을 넘어, 우리는 생성된 메커니즘을 사용하여 잠재적인 편향 패턴을 식별하고 목표 디바이어싱 데이터(debiasing data)를 구성하여 보상 모델의 미세 조정에 사용함으로써, 보상 해킹 벤치마크에서의 강건성(robustness)을 향상시킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기