확산 언어 모델을 위한 동적 청킹 (Dynamic Chunking)
요약
기존의 블록 이산 확산 언어 모델이 가진 고정된 위치 기반 분할의 한계를 극복하기 위해, 내용에 기반한 의미론적 청킹을 수행하는 DCDM(Dynamic Chunking Diffusion Model)을 제안합니다. DCDM은 학습 가능한 부분 공간을 통해 토큰을 클러스터링하는 청킹 어텐션을 사용하여, 시퀀스의 의미적 구조를 보존하며 자기회귀적으로 노이즈를 제거합니다. 실험 결과, DCDM은 최대 1.5B 파라미터 규모의 모델에서 기존 방식보다 일관되게 우수한 성능을 보여주었습니다.
핵심 포인트
- 고정된 위치 블록 대신 내용에 기반한 의미론적 청크(Semantic Chunks)를 사용함
- 청킹 어텐션(Chunking Attention)을 통해 토큰을 $K$개의 클러스터로 미분 가능한 방식으로 라우팅함
- 생성된 클러스터 할당을 통해 청크-인과적 어텐션 마스크를 유도하여 시퀀스 가능도를 인수분해함
- 기존 블록 이산 확산 모델을 엄격하게 일반화하며, 모델 규모와 상관없이 안정적인 성능 향상을 입증함
블록 이산 확산 언어 모델 (Block discrete diffusion language models)은 고정된 크기의 위치 블록 (positional blocks)에 대해 자기회귀적 (autoregressively)으로 시퀀스를 인수분해하며, 블록 내부의 병렬 노이즈 제거 (parallel denoising)와 블록 간의 조건화 (across-block conditioning)를 분리합니다. 우리는 이러한 경직된 분할이 시퀀스에 이미 존재하는 구조를 낭비한다고 주장합니다. 즉, 내용이 아닌 위치에 의해 정의된 블록은 의미론적으로 일관된 토큰들을 분리하고 관련 없는 토큰들을 하나로 묶어버립니다. 우리는 위치 블록을 내용에 의해 정의된 의미론적 청크 (semantic chunks)로 대체하는 extbf{D}ynamic extbf{C}hunking extbf{D}iffusion extbf{M}odel (DCDM)을 소개합니다. 그 핵심은 청킹 어텐션 (Chunking Attention)으로, 이는 학습 가능한 부분 공간 (subspaces)에 의해 매개변수화되고 확산 목적 함수 (diffusion objective)에 의해 엔드투엔드 (end-to-end)로 형성되는 $K$개의 클러스터로 토큰을 라우팅하는 미분 가능한 레이어입니다. 결과적으로 생성된 클러스터 할당은 청크-인과적 어텐션 마스크 (chunk-causal attention mask)를 유도하며, 이 마스크 아래에서 이산 확산 노이즈 제거기 (discrete diffusion denoiser)는 의미론적 청크에 대해 자기회귀적으로 시퀀스 가능도 (sequence likelihood)를 인수분해하며, 이는 블록 이산 확산 (block discrete diffusion)을 엄격하게 일반화합니다. 최대 1.5B 파라미터 규모의 다운스트림 벤치마크에서 DCDM은 비구조적 (unstructured) 및 위치 블록 확산 베이스라인 모두보다 일관되게 성능을 향상시켰으며, 이러한 이점은 규모에 관계없이 안정적이고 훈련 초기 단계부터 나타납니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기