MoSAR: 적응적이고 근사 가능한 어텐션 기하학 학습을 위한 의미론적 어텐션 레짐 혼합 (Mixture of Semantic
요약
MoSAR은 기존의 이차 복잡도를 가진 밀집 어텐션 문제를 해결하기 위해, 데이터로부터 적응적이고 제어된 상호작용 기하학을 학습하는 새로운 접근법을 제시합니다. 이는 위치별 관련성에 따라 짧고 중간, 전역적인 세 가지 레짐을 혼합하여 연속적인 거리 의존적 어텐션 필드를 유도하며, 기존 모델 대비 우수한 언어 모델링 성능과 길이 외삽 능력을 보여줍니다.
핵심 포인트
- MoSAR은 적응적이고 제어된 어텐션 기하학 학습에 초점을 맞춥니다.
- 쿼리-키 라우터를 통해 짧음/중간/전역 레짐을 혼합하여 연속적인 패턴을 유도합니다.
- 밀집 RoPE보다 우수한 퍼플렉시티를 달성하며 길이 외삽 성능이 뛰어납니다.
- 학습된 기하학은 추론 시 저비용의 top-1 이산화가 가능합니다.
밀집(dense) 자체 어텐션의 이차 복잡도는 긴 컨텍스트 길이 언어 모델링에서 여전히 핵심 병목 현상으로 남아 있습니다. 많은 효율적인 대안들은 어텐션이 어디서 희소하거나 국지적이어야 하는지를 미리 결정함으로써 이 비용을 해결합니다. 우리는 대신 어텐션 근사(approximation)를 데이터로부터 관련 상호작용 기하학(interaction geometry)을 학습하는 기하학적 문제로 접근해야 한다고 주장합니다: 자연어 의존성은 입력에 따라 달라지며 사전에 지정하기 어렵기 때문에, 모델은 위치적 관련성(positional relevance)이 어디서 감소할 수 있고 어느 곳에서 더 넓은 상호작용을 유지해야 하는지를 학습해야 합니다. 우리는 쿼리-키 상호작용(query--key interactions)에 걸쳐 이러한 적응적이고 제어된 감쇠 기하학을 학습하는 의미론적 어텐션 레짐 혼합(Mixture of Semantic Attention Regimes, MoSAR)을 소개합니다. 위치 인코딩(positional encoding) 이후에 적용되는 입력 조건부 쿼리 및 키 라우터(query and key routers)는 짧은(short), 중간(medium), 그리고 전역적(global) 레짐에 대한 혼합을 선택하여 고정된 희소성 패턴 대신 연속적인 거리 의존적 어텐션 필드(distance-dependent attention field)를 유도합니다. 이 기하학은 훈련 중에 학습되며, 이후 top-1 라우팅을 통해 이산화될 수 있습니다. 매칭되는 500M 파라미터 모델로 수행된 제어된 사전 훈련 실험에서, MoSAR는 언어 모델링 품질 저하 없이 상당히 낮은 도달 범위의 어텐션 기하학을 학습하여, 훈련 컨텍스트 길이에서 밀집 RoPE보다 더 나은 퍼플렉시티(perplexity)를 달성합니다. 길이 외삽(length extrapolation) 하에서도, MoSAR는 ALiBi와 같은 강력한 기준선들을 포함하여 평가된 모든 변형 중에서 가장 좋은 퍼플렉시티를 달성합니다. 더욱이, 학습된 기하학은 결정론적 top-1 이산화 하에서도 안정적으로 유지되며, 이는 단순히 적응적일 뿐만 아니라 추론 시간(inference time)에 저비용 근사화가 가능하다는 것을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기