언어에서의 JEPA 역설: 언어적 대안의 기하학
요약
JEPA 방식의 잠재 예측이 텍스트 데이터에서 겪는 한계를 분석한 연구입니다. 이미지와 달리 언어는 하나의 문맥에 대해 여러 유효한 토큰이 존재할 수 있어, 결정론적 예측 시 중심점 퇴화와 모델 붕괴가 발생함을 설명합니다.
핵심 포인트
- JEPA의 잠재 예측 방식과 언어의 조건부 구조 간 불일치 규명
- 텍스트 예측 시 발생하는 중심점 퇴화 및 코사인 붕괴 현상 분석
- 예측 가능성, 비붕괴, 낮은 조건부 분산의 세 가지 핵심 조건 제시
- 언어용 JEPA는 여러 가능한 완성을 하나의 점으로 압축하지 않고 보존해야 함
Joint-Embedding Predictive Architectures (JEPAs)는 이미지, 비디오, 오디오에는 효과적이지만, 결정론적인 (deterministic) JEPA 스타일의 잠재 예측 (latent prediction)은 텍스트 인코더를 위한 표준 목적 함수 (objective)로 자리 잡지 못했습니다. 우리는 이러한 격차가 제곱 오차 (squared-error) 잠재 예측과 언어의 조건부 구조 (conditional structure) 사이의 불일치를 반영한다고 주장합니다. 핵심 요구 사항은 조건부 집중 (conditional concentration)입니다. 즉, 문맥 (context)과 대상 위치 (target location)가 주어졌을 때, 대상 표현 (target representation)은 하나의 의미 있는 지점 근처에 위치해야 합니다. 국소적 이미지 예측 (Local image prediction)은 공간적 연속성 (spatial continuity)을 통해 이를 충족하는 경우가 많지만, 마스크된 텍스트 (masked text)는 여러 개의 유효한 토큰 (token) 또는 스팬 (span) 완성이 가능하며, 이들의 표현이 반드시 일관된 중심을 공유할 필요는 없습니다. 우리는 예측 가능성 (predictability), 비붕괴 (non-collapse), 낮은 조건부 분산 (low conditional variance)이라는 세 가지 조건을 통해 이러한 불일치를 공식화하고, 이 조건들의 실패가 텍스트에서 중심점 퇴화 (centroid degeneracy)와 붕괴 압력 (collapse pressure)을 어떻게 유발하는지 보여줍니다. 매칭된 I-JEPA 및 T-JEPA 실험은 다음과 같은 예측된 시퀀스를 드러냅니다: 상호 정보량 (mutual-information) 포화와 높아진 대상 분산 (target variance)이 훈련-검증 불안정성 (train--validation instability), 유효 순위 퇴화 (effective-rank degeneration), 코사인 붕괴 (cosine collapse), 그리고 낮은 다운스트림 전이 (downstream transfer) 성능에 앞서 발생합니다. 동일한 패턴이 다섯 개의 독립적인 데이터 시드 (data seeds) 전반에서 나타나며, 이는 이것이 샘플링 아티팩트 (sampling artifact)가 아님을 나타냅니다. 이러한 결과가 언어를 위한 예측 학습 (predictive learning)을 배제하는 것은 아닙니다. 대신, 텍스트와 호환 가능한 JEPA 목적 함수는 여러 가능한 완성을 하나의 잠재 지점 (latent point)으로 압축하기보다 이를 보존해야 함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기