Byte-Prefix Marginalization을 통한 교차 토크나이저 온-정책 증류 (Cross-Tokenizer On-Policy
요약
서로 다른 토크나이저를 사용하는 모델 간의 온-정책 증류(OPD) 효율을 높이기 위한 Byte-Prefix Marginalization(BPM) 기술을 제안합니다. BPM은 바이트 공간을 활용해 교사 모델의 확률 질량을 학생 모델의 어휘로 정확하게 재표현하여 정보 손실을 최소화합니다.
핵심 포인트
- 교차 토크나이저 환경에서 확률 질량 손실 문제를 해결하는 BPM 기법 제안
- 바이트 접두사를 활용해 교사 모델의 분포를 학생 모델 어휘로 정렬
- Qwen3, GLM-Z1 등 다양한 모델을 통해 수학 및 프로그래밍 성능 향상 입증
- 기존 방식 대비 벤치마크 평균 성능을 3.7~6.6 포인트 개선
서로 다른 계열의 오픈 웨이트 (Open-weight) 언어 모델들은 상호 보완적인 능력을 보여주며, 이는 온-정책 증류 (On-Policy Distillation, OPD)를 통해 이들을 하나의 컴팩트한 학생 모델 (Student)로 통합하려는 동기를 부여합니다. 그러나 전체 어휘 (Full-vocabulary) OPD는 일반적으로 토크나이저 (Tokenizer)를 공유한다고 가정하는 반면, 기존의 교차 토크나이저 (Cross-tokenizer) 방식은 교사 모델 (Teacher)의 확률 질량 (Probability mass)을 버리거나 관련 없는 콘텐츠를 가진 학생 토큰에 할당할 수 있습니다. 우리는 교사 모델의 다음 토큰 분포 (Next-token distribution)를 공유된 바이트 공간 (Byte space) 상에서 학생 어휘로 재표현하는 Byte-Prefix Marginalization (BPM)을 소개합니다. 구체적으로, BPM은 각 교사 토큰의 확률을 해당 교사 토큰의 바이트 표현이 접두사 (Prefix)가 되는 가장 긴 학생 토큰에 할당하고, 동일한 학생 토큰에 매핑된 질량을 집계하며, 일치하지 않는 나머지 질량은 명시적인 잔차 범주 (Residual category)에 배치합니다. 이는 밀집 OPD (Dense OPD)를 위해 어휘가 완전하고 (Vocabulary-complete), 바이트가 정렬되었으며 (Byte-aligned), 질량이 보존되는 (Mass-preserving) 타겟을 생성합니다. 관련 접두사가 여러 교사 토큰에 걸쳐 있지 않을 때 (훈련 위치의 99% 이상에서 충족되는 조건), 이 타겟은 교사가 유도한 바이트-접두사 주변 확률 (Byte-prefix marginal)을 정확하게 복구하며, 그렇지 않은 경우에는 질량을 보존하는 체인-인수분해 하한 (Chain-factorized lower bound)을 사용합니다. Qwen3-32B, GLM-Z1-9B-0414, MiniMax-M2.7을 교사 모델로 사용했을 때, BPM은 6개의 수학 및 프로그래밍 벤치마크에서 기존의 교차 토크나이저 방식들을 일관되게 능가하였으며, 가장 강력한 베이스라인 대비 6개 벤치마크 평균 avg@8을 3.7~6.6 포인트 향상시켰습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기