HiLS Attention: Tencent이 400만 토큰까지 확장 가능한 희소 어텐션 (Sparse Attention) 메커니즘을 구축한 방법
요약
Tencent의 Hunyuan 팀이 400만 토큰까지 확장 가능한 새로운 희소 어텐션 메커니즘인 HiLS Attention을 발표했습니다. 랜드마크 토큰과 미분 가능한 청크 선택 방식을 통해 훈련 시보다 훨씬 긴 문맥에서도 성능 저하 없이 효율적인 연산이 가능합니다.
핵심 포인트
- 400만 토큰까지 확장 가능한 장기 문맥 모델링 구현
- 미분 가능한 청크 선택을 통해 훈련 손실 함수와 최적화 통합
- 랜드마크 토큰을 활용한 효율적인 청크 질량 근사
- 512K 토큰 기준 기존 방식 대비 13~15배 빠른 속도 구현
- 7B 모델 및 오픈 소스 코드 공개
HiLS Attention: Tencent이 400만 토큰까지 확장 가능한 희소 어텐션 (Sparse Attention) 메커니즘을 구축한 방법
장기 문맥 모델링 (Long-context modeling)의 핵심에는 지속적인 긴장 관계가 존재합니다. 전체 어텐션 (Full attention)은 정확하지만 시퀀스 길이(Sequence length)에 따라 제곱으로 늘어나는 반면, 희소 어텐션 (Sparse attention)은 빠르지만 훈련 윈도우 (Training window)를 벗어나면 성능이 급격히 저하되는 경향이 있습니다. Tencent의 Hunyuan 팀에서 발표한 새로운 논문인 HiLS Attention (arXiv:2607.02980)은 어텐션을 더 영리하게 근사하는 방식이 아니라, 청크 선택 (Chunk selection) 자체를 모델의 학습 가능한 부분으로 만듦으로써 이 긴장 관계를 해결하는 방법을 제안합니다.
그 결과, 도메인 내 길이에서는 전체 어텐션 (Full-attention)과 동일한 품질을 유지하면서, 훈련 시보다 64배 이상 긴 문맥으로 확장(Extrapolate)이 가능하며, 512K 토큰에서 13~15배 더 빠르게 작동하는 메커니즘을 구현했습니다. HiLS로 훈련된 7B 모델은 Hugging Face에서 사용 가능하며, 코드는 오픈 소스로 공개되어 있습니다.
청크 단위 희소 어텐션 (Chunk-Wise Sparse Attention)이 외삽 (Extrapolation)에서 일반적으로 실패하는 이유
장기 문맥 효율성을 위한 표준적인 접근 방식은 시퀀스를 청크 (Chunks)로 나누고 선택된 일부 서브셋에만 어텐션을 수행하는 것입니다. 문제는 이러한 청크를 어떻게 선택하느냐입니다. 대부분의 방법은 평균 풀링된 키 (Mean-pooled keys), 최대 풀링된 키 (Max-pooled keys), 또는 고정된 슬라이딩 윈도우 (Fixed sliding windows)와 같은 휴리스틱 (Heuristics)을 사용합니다. 이러한 방식은 훈련 분포 내에서는 상당히 잘 작동하지만, 문맥이 모델이 훈련 중에 보았던 것보다 훨씬 길어지면 무너집니다.
더 깊은 문제는 휴리스틱 청크 선택기 (Heuristic chunk selectors)가 훈련 손실 (Training loss)에 의해 최적화되지 않는다는 점입니다. 모델은 선택된 청크가 무엇이든 그것을 사용하는 법은 배우지만, 더 나은 청크를 선택하는 법은 배우지 못합니다. 이는 모델의 나머지 부분은 적응하는 동안 선택 메커니즘은 고정되어 있는 불일치를 초래합니다.
HiLS는 청크 선택을 미분 가능하게 (Differentiable) 만들고 이를 언어 모델링 목적 함수 (Language modeling objective)에 직접 통합함으로써 이 문제를 해결합니다.
핵심 아이디어: 랜드마크 토큰 (Landmark Tokens) 및 계층적 인수분해 (Hierarchical Factorization)
HiLS는 각 청크(chunk)의 끝에 추가되는 **랜드마크 토큰 (landmark token)**을 도입합니다. 이 토큰은 해당 청크 내용의 학습 가능한 요약본 역할을 합니다. 단순한 풀링 (pooling) 연산을 사용하는 대신, 랜드마크 키 (landmark key)는 전체 어텐션 (full-attention)에 의해 유도된 청크 질량 (chunk mass)의 1차 테일러 전개 (first-order Taylor expansion)를 사용하여 도출됩니다. 이는 본질적으로, 모델이 모든 정보를 볼 수 있다면 해당 청크에 얼마나 많은 어텐션을 할당할 것인지에 대한 원칙적인 근사치 (approximation)입니다.
그 후 어텐션 메커니즘은 다음의 두 단계로 인수분해 (factorized)됩니다:
- 청크 간 어텐션 (Inter-chunk attention): 쿼리 (query)가 모든 청크에 걸친 랜드마크 토큰들에 어텐션을 수행하여 청크들에 대한 분포를 계산합니다 (어떤 청크들이 중요한가?).
- 청크 내 어텐션 (Intra-chunk attention): 선택된 청크들 내부에서, 표준 어텐션 (standard attention)이 개별 토큰들 사이에 질량을 분배합니다 (해당 청크 내의 어떤 토큰들이 중요한가?).
랜드마크 키가 순전파 (forward) 계산에 참여하기 때문에, 다음 토큰 예측 손실 (next-token prediction loss)로부터 발생하는 그래디언트 (gradients)가 랜드마크 표현 (landmark representations)으로 직접 흐릅니다. 모델은 별도의 사전 학습 (pretraining) 목적 함수로서가 아니라, 텍스트를 예측하는 법을 배우는 자연스러운 결과로서, 검색하기 쉬운 방식으로 청크를 요약하는 법을 학습합니다.
실제 적용을 가능하게 하는 엔지니어링 세부 사항
본 논문에는 HiLS를 사용하거나 수정할 계획이라면 이해할 가치가 있는 몇 가지 구현 선택 사항들이 포함되어 있습니다.
쿼리 보정 (Query Calibration, Q-Cal): 경량 저차원 (low-rank) 모듈이 청크 수준의 질량 추정을 위해 쿼리를 구체적으로 조정합니다. 그 직관은 토큰 수준의 어텐션에 유용한 쿼리 표현이 청크 수준의 선택에 유용한 표현과 반드시 같지는 않다는 것입니다. Q-Cal은 작은 학습 가능한 오프셋 (offset)인 Δq = W_up · W_down · h를 추가하며, 여기서 h는 은닉 상태 (hidden state)입니다. 이는 파라미터(parameter)를 최소한으로 추가하면서도 청크 검색 정확도를 의미 있게 향상시킵니다.
계층적 위치 인코딩 (Hierarchical Positional Encoding, HoPE): 표준 RoPE 임베딩 (RoPE embeddings)은 절대적 위치를 인코딩하며, 이는 학습 길이를 훨씬 벗어나 외삽(extrapolate)할 때 문제를 일으킵니다. HiLS는 사전 학습(pre-training) 컨텍스트 창 내의 차원에는 RoPE를 사용하고, 그 범위를 벗어나는 차원에는 NoPE (no positional encoding, 위치 인코딩 없음)를 사용합니다. 이러한 하이브리드 접근 방식은 모델이 위치를 인식하는 어텐션 (attention)을 통해 익숙한 단거리 패턴을 처리하는 동시에, 더 긴 범위에서는 절대적 위치에 구애받지 않도록(agnostic) 해줍니다.
하드웨어 효율적 커널 (Hardware-Efficient Kernel): 인접한 쿼리(query)들은 중복되는 청크(chunk) 세트를 검색하는 경향이 있습니다. 논문에 따르면 인접한 쿼리 간의 중복도는 92.8%에 달합니다. HiLS는 이를 활용하여 M개의 인접한 쿼리를 함께 배치(batching)하고, 선택된 청크들의 합집합을 한 번만 로드한 뒤, 단 한 번의 패스(pass)로 M개 쿼리 모두에 대한 어텐션을 계산합니다. 이 "일회 로드 다중 계산 (one-load-multiple-compute)" 전략은 Tensor Core 활용도를 크게 향상시키며, 대규모 추론 속도 향상의 주요 원인이 됩니다.
수치적 결과
345M 파라미터 규모에서 HiLS는 32K 컨텍스트에서 4.34, 512K 컨텍스트에서 5.95의 퍼플렉시티 (perplexity)를 유지합니다. 반면 표준 풀 어텐션 (full-attention) 모델은 32K 토큰을 넘어서면 완전히 실패합니다 (퍼플렉시티 100 이상). 긴 컨텍스트에서의 멀티 홉 검색 (multi-hop retrieval)을 테스트하는 RULER 벤치마크에서 HiLS는 32K 컨텍스트 기준 100/95/68의 점수를 기록하며, 풀 어텐션 베이스라인을 실질적으로 압도했습니다.
더 큰 규모의 결과는 더욱 놀랍습니다. 저자들이 50B 토큰에 대한 지속적 사전 학습 (continued pre-training)을 통해 OLMo3-7B에 HiLS를 적용했을 때, 결과 모델은 128K 컨텍스트의 RULER에서 94.67점을 기록했습니다. 이와 유사한 Landmark Attention 튜닝 방식은 동일한 벤치마크에서 0.67점을 기록했습니다. 이 격차는 미미한 수준이 아닙니다. 이는 휴리스틱 (heuristic) 방식과 학습된 청크 선택 (learned chunk selection) 방식 사이의 근본적인 차이를 반영합니다.
추론 지연 시간 (inference latency) 측면에서, 512K 컨텍스트에서 HiLS는 동일한 하드웨어의 풀 어텐션 (full attention)과 비교했을 때 프리필 (prefill) 단계에서 13.5배 더 빠르며, 디코드 단계당 (per decode step) 15.7배 더 빠릅니다. 프리필과 디코드 모두 컨텍스트 길이에 따라 이차 함수적 (quadratically)이 아닌 선형적 (linearly)으로 확장됩니다.
기존 모델을 HiLS로 전환하기
이 논문의 실용적인 측면 중 하나는 HiLS가 처음부터 학습시키는 대신, 추가 사전 학습 (continued pre-training)을 통해 기존의 풀 어텐션 (full-attention) 모델에 적용되도록 설계되었다는 점입니다. 저자들은 OLMo3-7B를 사용하여 약 50B 토큰의 추가 사전 학습을 통해 모델을 전환함으로써 이를 입증했습니다. 전환된 모델은 짧은 컨텍스트 능력(MMLU 점수 유지)을 유지하면서도 긴 컨텍스트 외삽 (long-context extrapolation) 능력을 얻게 됩니다.
공식 저장소에는 처음부터 학습시키는 방식과 추가 사전 학습을 위한 스크립트가 모두 포함되어 있으며, RULER, LongBench 및 퍼플렉시티 (perplexity) 벤치마크를 위한 평가 파이프라인도 함께 제공됩니다. 추론은 HiLS를 OpenAI 호환 API 서빙을 지원하는 퍼스트 클래스 어텐션 백엔드로 취급하는 전용 SGLang 포크 (dedicated SGLang fork)를 통해 지원됩니다.
실무자들에게 주는 의미
가장 즉각적인 시사점은 긴 문서 검색 (long-document retrieval), 다회차 대화 (multi-turn conversation), 또는 대규모 저장소에 대한 코드 이해 (code understanding) 작업을 수행하는 팀들에게 있습니다. 현재 128K 또는 256K 컨텍스트 윈도우(context window)와 함께 풀 어텐션 (full attention)을 사용하고 있다면, HiLS는 이차 함수적 비용 없이, 그리고 극단적인 길이에서 희소 어텐션 (sparse attention) 시 일반적으로 발생하는 품질 저하 없이 컨텍스트를 수백만 토큰까지 확장할 수 있는 경로를 제공합니다.
이 전환 방식은 특히 유용합니다. 모델을 처음부터 새로 학습시킬 필요가 없기 때문입니다. 잘 튜닝된 베이스 모델 (base model)을 보유하고 있다면, HiLS를 통한 추가 사전 학습 (continued pre-training)은 긴 컨텍스트 능력을 확보하기 위한 실행 가능한 경로가 됩니다.
더 넓은 관점에서의 핵심은 방법론에 있습니다. HiLS는 희소 어텐션 (Sparse Attention)에 개입해야 할 올바른 지점이 어텐션 커널 (Attention Kernel) 자체가 아니라, 청크 선택 메커니즘 (Chunk Selection Mechanism)임을 보여줍니다. 선택 과정을 엔드투엔드 (End-to-end)로 학습 가능하게 만들고, 이를 하드웨어 효율적인 (Hardware-efficient) 방식으로 구현함으로써, 효율성 이점을 유지하면서도 희소 어텐션과 풀 어텐션 (Full Attention) 사이의 품질 격차를 대부분 해소합니다. 이는 선택 과정에 점점 더 많은 휴리스틱 (Heuristics)을 추가하는 일반적인 대안보다 더 깔끔한 해결책입니다.
논문은 arXiv:2607.02980에서 확인할 수 있으며, 모델 가중치는 tencent/HiLS-Attention-7B에, 전체 코드베이스는 Tencent-Hunyuan/HiLS-Attention에 공개되어 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기