HLA: 청크 단위 동적 혼합을 통한 표현력 높은 하이브리드 선형 어텐션
요약
HLA(Hybrid Linear Attention)는 기존 선형 어텐션의 한계를 극복하기 위해 제안된 새로운 메커니즘입니다. 이는 완료된 청크를 아핀 상태 전이로 표현하고, 내용 의존적 라우팅 게이트를 계산하여 역사적 정보를 효율적으로 관리합니다. 평가 결과, HLA는 Qwen3.5 모델 등에서 네이티브 GDN 및 고정 혼합 방식 대비 장문맥 성능을 크게 향상시켰습니다.
핵심 포인트
- HLA는 청크별 아핀 상태 전이를 통해 정보 손실을 최소화합니다.
- 내용 의존적 라우팅 게이트가 역사적 전이를 정교하게 제어합니다.
- Qwen3.5 모델 등에서 장문맥 성능 향상(LongBench-V2 최대 5.57%p)이 입증되었습니다.
- 쿼리 의존적 조합을 통해 학습 컨텍스트를 넘어 효과적으로 정보를 유지합니다.
선형 어텐션(Linear attention)은 히스토리(history)를 순환 상태(recurrent states)로 압축하여 효율적인 장문맥 자기회귀 디코딩(long-context autoregressive decoding)을 가능하게 하지만, 이러한 압축 방식은 희소하고 먼 정보에 대한 선택적 접근을 어렵게 만들 수 있습니다. 기존의 청크 기반 확장 기법들은 메모리 용량을 늘렸지만, 학습된 청크 혼합 계수(chunk-mixing coefficients)가 입력 내용과 관계없이 고정되는 경우가 많아 역사적 접근을 각 쿼리에 맞게 조정할 수 없습니다. 우리는 Gated DeltaNet (GDN)을 위한 쿼리 의존적 청크 레벨 어텐션 메커니즘인 extit{Hybrid Linear Attention} (HLA)을 소개합니다. HLA는 완료된 각 청크를 정확한 아핀 상태 전이(affine state transition)로 표현하고, 간결하게 자기-어텐티브 풀링된 대표자들로부터 내용 의존적 라우팅 게이트(content-dependent routing gates)를 계산합니다. 각 게이트는 해당 역사적 전이를 항등 사상(identity map)과 보간하여 청크의 가산 메모리(additive memory)와 이전 상태에 대한 변환을 모두 제어합니다. 효과 지지 정규화(Effective-support regularization)는 희소 추론(sparse inference)을 위해 집중된 라우팅을 더욱 장려합니다. 우리는 사전 학습 적응(pretrained adaptation)과 처음부터 학습(from-scratch training)의 두 가지 환경에서 HLA를 평가했습니다. 0.8B부터 9B까지의 Qwen3.5 모델에 걸쳐, HLA는 네이티브 GDN 및 고정 청크 혼합 방식보다 일관되게 성능을 개선했으며, LongBench-V2에서는 최대 5.57% 포인트, RULER에서는 3.97% 포인트의 향상을 보였습니다. 통제된 환경에서 100B 토큰으로 학습하고 4K 컨텍스트를 사용한 1.3B 모델에서도 HLA는 RULER 성능을 4K에서 32K로 개선했으며, 그 향상은 4K에서의 0.83 포인트에서 32K에서의 4.22 포인트까지 증가했습니다. 이러한 결과들은 순환 메모리의 쿼리 의존적 조합이 장문맥 모델링을 개선하며, 간결한 청크별 아핀 요약(affine summaries)을 사용하면서도 학습 컨텍스트를 넘어 효과적으로 유지됨을 입증합니다. 프로젝트 페이지: https://caesarhhh.github.io/hla/
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기