MDLMPE: 마스크 확산 언어 모델을 위한 분포 인식 위치 인코딩 (Distribution Aware Positional Encoding)
요약
마스크 확산 언어 모델(MDLM)의 비연속적인 토큰 구성 문제를 해결하기 위해 설계된 새로운 위치 인코딩 방식인 MDLMPE를 제안합니다. 토큰 가용성 분포를 인식하는 이 방식은 기존 RoPE보다 우수한 성능을 보입니다.
핵심 포인트
- MDLM의 동적이고 비연속적인 토큰 구성에 최적화된 위치 인코딩 제안
- 토큰 가용성을 이진 시퀀스로 나타내고 가우시안 가중치를 적용하는 방식
- LLaDA 및 DREAM 모델 실험을 통해 사전 학습 및 제로샷 성능 향상 입증
- 가용성 상태와 스펙트럼 기저의 조합이 모델 성능의 핵심임을 확인
마스크 확산 언어 모델 (Masked Diffusion Language Models, MDLMs)은 병렬 생성과 양방향 문맥 모델링을 가능하게 하지만, 이들의 위치 문맥 (positional context)은 자기회귀 (Autoregressive, AR) 모델의 문맥과는 근본적으로 다릅니다. AR 디코딩이 연속적인 접두사 (prefix)를 노출하는 반면, MDLM 디노이징 (denoising)은 드러난 토큰과 마스킹된 토큰의 동적이고 비연속적인 구성을 생성합니다. RoPE와 같은 기존의 위치 인코딩 (positional encodings)은 시퀀스 순서와 쌍별 변위 (pairwise displacement)를 포착하지만, 이러한 진화하는 토큰 가용성 구조 (token-availability structure)에는 민감하게 반응하지 못합니다.
이러한 한계를 해결하기 위해, 우리는 마스크 확산 (masked diffusion)을 위해 특별히 설계된 위치 인코딩인 MDLMPE를 제안합니다. 우리가 알고 있는 바로는, MDLMPE는 위치 표현이 변화하는 드러남/마스킹 구성 (revealed/masked configuration)을 명시적으로 인식하도록 만든 최초의 방법입니다. 이 방법은 토큰 가용성을 이진 시퀀스 (binary sequence)로 나타내고, 거리 인식 가우시안 가중치 (distance-aware Gaussian weighting)를 적용하며, 결과적인 패턴을 코사인 기저 (cosine basis)를 통해 투영하여 분포 인식 위치 특징 (distribution-aware positional features)을 얻습니다. 이러한 특징들은 토큰 임베딩 (token embeddings)에 더해지며, 경량 MLP를 통해 표준 RoPE 위상 (phases)을 조절하는 각도 오프셋 (angular offsets)으로 매핑됩니다.
LLaDA 및 DREAM에 대한 광범위한 실험을 통해, MDLMPE가 지도 미세 조정 (supervised fine-tuning), 사전 학습 (pretraining), 제로샷 평가 (zero-shot evaluation) 및 블록 확산 (block-diffusion) 설정 전반에서 기존 위치 인코딩 방법들보다 일반적으로 우수한 성능을 보임을 입증했습니다. 추가적인 절제 연구 (ablations)를 통해 가용성 상태 (availability state), 가우시안 국소성 (Gaussian locality), 스펙트럼 기저 (spectral basis), 그리고 임베딩 주입 (embedding injection)의 완전한 조합이 가장 강력한 결과를 낸다는 것을 보여주었습니다. 이러한 결과는 진화하는 토큰 가용성 분포가 마스크 확산 언어 모델을 위한 유용한 위치 신호임을 확립합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기