학습을 위한 계획 (Planning to Learn)
요약
본문은 강화 학습의 핵심인 정책 경사(Policy-gradient) 방법과 분류기에서 사용되는 크로스 엔트로피 간의 근본적인 차이를 탐구합니다. 특히, 정확한 정책 경사는 단기적 이득에만 초점을 맞추는 반면, 크로스 엔트로피는 장기적인 관점(인내심 있는 정확도)을 제공한다는 점을 지적합니다.
핵심 포인트
- 정책 경사 방법은 LLM 후속 훈련 등 강화 학습의 핵심 요소입니다.
- 정확한 정책 경사는 단기적 이득에 초점을 맞추는 '제로 호라이즌 극한'입니다.
- 크로스 엔트로피는 장기적인 관점('인내심 있는 정확도')을 제공합니다.
- 실험 결과, 호라이즌 손실은 크로스 엔트로피보다 top-1 정확도를 개선했습니다.
정책 경사(Policy-gradient) 방법은 LLM 후속 훈련을 포함하여 현대 강화 학습(Reinforcement Learning)의 핵심입니다. 이 방법들이 어려움을 겪을 때, 일반적으로 의심받는 요소들은 탐험(exploration), 기여도 할당(credit assignment), 그리고 행동 샘플링 노이즈(action-sampling noise)입니다. 분류기(classifier)에는 이러한 요소들이 전혀 없습니다. 분류기는 기대 보상(expected reward), 즉 *기대 정확도(expected accuracy)*가 올바른 레이블에 할당하는 확률인 정책입니다. 이 레이블은 알려져 있기 때문에, 정책 경사(policy gradient)는 정확하고 부드럽습니다. 하지만 정확한 정책 경사는 기대 정확도에서도 크로스 엔트로피(cross-entropy)에 패배합니다. 정확한 경사는 근시안적입니다: 현재 무엇을 얻는지에 의해서만 업데이트의 가치를 평가하지만, 각 업데이트는 다음 시작점 또한 설정하기 때문에, 업데이트의 가치는 얼마나 많은 학습이 남아 있는지에 따라 달라집니다. 이런 관점에서 볼 때, 크로스 엔트로피는 인내심 있는 정확도(patient accuracy)이며, 이는 예시가 로그 오즈(log-odds)를 단위 속도로 영원히 상승시킬 경우 지불할 총 오류입니다. 반면, 정확한 정책 경사는 제로 호라이즌 극한(zero-horizon limit)입니다. 이 전체 학습량에서 남은 부분으로 잘라내는 것이 호라이즌 손실(horizon loss)이며, 이는 크로스 엔트로피에서 시작하여 훈련이 끝날수록 정확한 정책 경사 쪽으로 이동하는 한 줄의 변화입니다. 간단한 할당 모델에서는 각 종단점(endpoint)을 붙잡는 함정에서 증명적으로 벗어납니다. MNIST와 ResNet-50, ResNet-101 및 ViT-S/16을 사용한 ImageNet에서, 호라이즌 손실은 일정한 학습률에서 크로스 엔트로피보다 top-1 정확도를 개선하며, 레이블 노이즈가 증가함에 따라 그 이득도 커집니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기