DIAL-OPD: 온-폴리시 증류에서 더 적은 토큰으로 학습하기
요약
본 논문은 온-폴리시 증류(OPD)의 한계를 극복하기 위해 DIAL-OPD를 제안합니다. 이는 교사와 학생 모델의 확률 로그 평균을 사용하여 토큰 선택에 가중치를 부여하는 새로운 방법입니다. 실험 결과, DIAL-OPD는 전체 토큰 OPD 대비 적은 토큰만 유지해도 높은 성능 향상을 보였으며, 특히 수학적 추론 벤치마크에서 뛰어난 효과를 입증했습니다.
핵심 포인트
- DIAL-OPD는 교사-학생 확률 로그 평균을 이용해 토큰 선택에 가중치를 부여합니다.
- 전체 OPD 대비 적은 토큰만 유지해도 성능 향상(평균 정확도 5.25%p)이 확인되었습니다.
- 수학적 추론 벤치마크에서 AIME25 Pass@16이 두 배 증가하는 등 뛰어난 효과를 보였습니다.
- 효과적인 감독 할당이 교사 모델의 크기보다 중요할 수 있음을 시사합니다.
온-폴리시 증류(On-policy distillation, OPD)는 토큰 수준의 교사 신호로 학생이 생성한 궤적을 감독합니다. 이 샘플링된 토큰 변형은 전체 어휘 확률의 비용을 피할 수 있습니다. 하지만 우리는 더 적은 토큰으로 학습하는 것이 전체 토큰 OPD보다 성능이 우수할 수 있다는 것을 발견했으며, 이는 더 많은 감독이 학습을 개선한다는 직관에 도전합니다. 이러한 점은 가치를 학습하여 토큰을 선택하도록 동기를 부여합니다. 기존의 불일치 기반 기준은 확률 스케일을 무시합니다: 두 모델 모두에게 미미한 확률로 할당된 토큰(low-low tokens)은 큰 로그 비율 보상을 받을 수 있으며 학습을 방해할 수 있습니다. 우리는 DIAL-OPD를 제안합니다. 이는 교사와 학생의 확률의 로그 평균으로 보상 크기에 가중치를 부여하여 로그 확률과 확률 공간을 연결하는 토큰 선택 방법입니다. 매개변수 beta가 이 가중치를 제어하며, 가장 높은 점수를 받은 토큰이 유지됩니다. 4개의 교사-학생 쌍 및 7개의 수학적 추론 벤치마크에 걸쳐, 우리는 DIAL-OPD를 9개의 베이스라인과 비교합니다. 단지 40%의 토큰만 유지하는 것만으로도, 이는 Vanilla OPD와 그 전체 토큰 변형보다 우수하며, 평균 정확도는 Vanilla OPD 대비 5.25 퍼센트 포인트까지 향상되고 AIME25 Pass@16은 13.33%에서 26.67%로 두 배 증가합니다. 또한, 일치하는 유지 비율에서 가장 강력한 토큰 선택 베이스라인보다 평균 정확도에서 최대 18%의 상대적 개선을 달성합니다. 4B 교사를 사용할 때, DIAL-OPD는 8B 교사를 사용하는 가장 강력한 전체 토큰 베이스라인을 학생 규모 모두에서 능가하며, 이는 효과적인 감독 할당이 교사 스케일링보다 중요할 수 있음을 보여줍니다. 추가 분석에 따르면, 적절한 beta는 low-low tokens를 억제하는 것과 유용한 불일치를 보존하는 것 사이의 균형을 맞춥니다. 토큰 수준의 증거는 DIAL-OPD가 제한된 추론 가치를 가진 고보상 토큰을 필터링하면서도 추론 정확성에 중요한 감독은 보존한다는 것을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기