로컬 믹싱이 글로벌 NoPE 어텐션에서 상대적 위치를 인코딩하는 방식
요약
본 논문은 어텐션 연산이 본질적으로 위치 불변함에도 불구하고, SWA나 게이티드 선형 어텐션 같은 로컬 믹싱 레이어가 글로벌 NoPE 어텐션에서 어떻게 위치 정보를 암묵적으로 인코딩하는지 설명합니다. 핵심 주장은 이들이 잔차 스트림에 '최근성 편향(recency bias)'을 유도하며, 이것이 전역 어텐션 로짓으로 전달되어 작동한다는 것입니다.
핵심 포인트
- 로컬 믹싱 레이어가 글로벌 NoPE에서 위치를 암묵적으로 인코딩함.
- SWA와 게이티드 선형 어텐션은 잔차 스트림에 최근성 편향을 유도한다.
- 이러한 하이브리드 모델의 위치 인코딩은 긴 시퀀스에서도 유지될 수 있다.
- 본 연구는 무한히 긴 시퀀스로 외삽하는 방법에 통찰력을 제공한다.
어텐션 연산은 본질적으로 위치 불변(position invariant)합니다. 하지만 위치 정보는 자연어에 근본적이므로, 회전 위치 인코딩(RoPE)과 같은 트랜스포머 기반 모델에서는 다양한 명시적 위치 인코딩이 개발되어 왔습니다. 비록 명시적 위치 인코딩이 오랫동안 필요하다고 여겨져 왔지만, 슬라이딩 윈도우 어텐션(SWA)이나 게이티드 선형 어텐션처럼 로컬 믹싱 레이어를 삽입하는 최근 방법들은 글로벌 어텐션 레이어에서 위치를 인코딩하지 않음에도 불구하고(NoPE), 대규모 환경에서 성공적임이 밝혀졌습니다. 이러한 접근 방식이 어떻게 그리고 왜 작동하는지는 잘 알려져 있지 않습니다. 본 논문에서는 이와 같은 하이브리드 모델들이 어떻게 글로벌 NoPE 레이어에서 위치를 암묵적으로 인코딩할 수 있는지에 대한 설명을 개발합니다. 이론적 및 경험적 증거를 통해 뒷받침되는 우리의 핵심 주장은, SWA와 게이티드 선형 어텐션이 잔차 스트림(residual stream)에 최근성 편향(recency bias)을 유도하며, 이 편향이 글로벌 어텐션 로짓(logits)으로 전파되고 선택된다는 것입니다. 더욱이, 오직 글로벌 NoPE 어텐션만 있는 모델에서 발견되는 암묵적 위치 인코딩은 위치 정보가 오직 인과 마스크(causal mask)로부터만 발생하는 것과는 달리, 하이브리드 모델의 최근성 편향은 긴 시퀀스에 걸쳐 유지될 수 있습니다. 하이브리드 모델이 어떻게 위치를 인코딩하는지에 대한 이해를 심화시키는 것 외에도, 이러한 발견들은 무한히 더 긴 시퀀스 길이로 외삽(extrapolate)할 수 있는 방식으로 위치를 인코딩하는 방법에 통찰력을 제공할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기