Off-Policy Merging이 On-Policy Self-Distillation보다 지속적 학습에 우수하다
요약
본 논문은 AI 모델의 지속적 학습(Continual Learning) 문제를 다루며, 기존 지식 손실을 최소화하는 새로운 방법론을 제시합니다. 특히 오프-정책 병합(off-policy merging) 기법인 '그라프팅(grafting)'이 온-정책 Self-Distillation보다 우수함을 입증했습니다. 이는 모델 업데이트를 적용하는 시점과 방식을 개선하여 효율적인 지속적 학습을 가능하게 합니다.
핵심 포인트
- 지속적 학습에서 SFT는 파국적 망각 문제를 유발할 수 있습니다.
- 오프-정책 병합 기법인 '그라프팅'이 기존 방법론보다 우수합니다.
- 가중치 업데이트를 적용하는 시점과 스케일링을 통해 간섭을 줄입니다.
- 온-정책 훈련 필수라는 통념에 도전하며 효율적인 학습 방법을 제시했습니다.
AI의 오랜 목표 중 하나는 스스로 계속 학습하고 개선할 수 있는 모델을 만드는 것입니다. 새로운 데이터로 사후 훈련된(post-trained) 모델에 지도 미세 조정(SFT: Supervised Finetuning)을 하는 것은 종종 낮은 일반화 성능과 파국적 망각(catastrophic forgetting)을 유발합니다. 따라서 통상적인 지혜는 지속적 학습을 위해 온-정책 훈련(on-policy training)이 필수 전제 조건이라는 것입니다. 하지만 실제로는 새로운 지식이나 능력을 포함하는 데이터가 종종 오프-정책(off-policy)인 경우가 많습니다. On-Policy Self-Distillation (OPSD)과 같은 방법들은 오프-정책 데이터를 온-정책 신호로 변환하여 이 격차를 해소하려고 시도하지만, 추론 붕괴(reasoning collapse)를 유발하는 것으로 나타났습니다. 본 논문에서 우리는 오프-정책 병합(off-policy merging)이 지속적 학습에 있어 OPSD보다 우수함을 보여줍니다. 먼저 SFT가 새로운 데이터로부터 유용한 신호를 학습하지만, 그 업데이트를 무분별하게 적용하면 기존 능력을 방해한다는 것을 보여줍니다. 우리는 '그라프팅(grafting)'이라고 명명한 간단한 방법으로 이 간섭을 줄입니다. 이는 업데이트가 학습되는 위치와 적용 방식에 변화를 줍니다: (1) 더 이른 시점의 도너 체크포인트(donor checkpoint), 이상적으로는 사전 훈련 종료 이전에서 업데이트를 학습하고, 가중치 업데이트를 사후 훈련된 모델에 적용하는 것; (2) 가중치 업데이트를 스케일링하는 것. 이는 일종의 모델 병합(model merging)과 같습니다; 그리고 (3) 선택적으로, 새로운 데이터 분포가 사후 훈련된 모델과 거리가 먼 경우 가장 민감한 업데이트 방향을 마스킹하는 것입니다. 전문가 트레이스(expert traces)로부터 증류하거나, STaR 및 Pedagogical RL을 이용한 자체 개선, 또는 사전 훈련 차단점 이후에 지식을 주입하는 등 다양한 지속적 학습 환경에서 그라프팅은 새로운 작업과 이전 작업 성능 모두에서 SFT와 OPSD를 능가하며, 값비싼 온-정책 샘플링을 피합니다. 따라서 우리의 연구는 RL로 훈련된 모델의 지속적 학습에 있어 온-정책 훈련이 필수적이라는 통념에 도전합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기