문맥 가중치를 적용한 이산 플로우 매칭 (Context-weighted Discrete Flow Matching)
요약
이산 플로우 매칭 모델의 생성 품질을 높이기 위해 국소 문맥 정보를 통합하는 새로운 프레임워크를 제안합니다. 문맥 가중 샘플러와 스케일링된 교차 엔트로피 손실 함수를 통해 OpenWebText 기준 생성 퍼플렉시티를 최대 63% 감소시켰습니다.
핵심 포인트
- 국소 문맥 밀도를 활용한 문맥 가중 샘플러 제안
- 스케일링된 교차 엔트로피 손실로 학습 신호 가중치 재조정
- OpenWebText에서 생성 퍼플렉시티 최대 63% 개선
- 준-자기회귀 블록 확산 베이스라인과 대등한 생성 품질 달성
이산 플로우 매칭 (Discrete flow matching)은 이산 구조 (discrete structures)에서의 생성 모델링 (generative modeling)을 위한 유연한 프레임워크를 제공합니다. 그러나 표준적인 인수분해된 학습 목적 함수 (factorized training objective)는 모델을 다양한 난이도의 타겟에 노출시키며, 상태가 양호하고 예측 가능한 토큰과 모호하고 엔트로피가 높은 토큰을 혼합합니다. 우리는 각 토큰의 값에 대한 불확실성이 해당 주변부의 가용 문맥 (context) 밀도와 밀접하게 관련되어 있음을 경험적으로 입증합니다. 이러한 관찰에 착안하여, 우리는 국소 문맥 (local context) 정보를 통합하는 기초 연속 시간 마르코프 체인 (continuous-time Markov chain, CTMC)에 대한 간단한 수정을 제안합니다. 우리의 문맥 가중 샘플러 (context-weighted sampler)는 무시할 수 있는 수준의 계산 오버헤드로 생성 품질을 향상시키는 반면, 우리가 제안하는 스케일링된 교차 엔트로피 손실 함수 (scaled cross-entropy loss function)는 서로 다른 토큰으로부터 오는 학습 신호의 가중치를 재조정하여 OpenWebText에서 생성 퍼플렉시티 (generative perplexity)를 최대 63%까지 감소시킵니다. 또한, 우리의 접근 방식은 임의의 순서로 생성을 수행할 수 있는 능력을 유지하면서도 강력한 준-자기회귀 블록 확산 (semi-autoregressive block diffusion) 베이스라인과 대등한 품질을 보여줍니다. 이러한 결과는 이산 생성 모델링 (discrete generative modeling)에서 국소 문맥의 역할이 중요한 요소임을 강조하며, 간단한 문맥 인식 (context-aware) 수정만으로도 샘플링과 학습 효율성을 모두 크게 개선할 수 있음을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기