어텐션이 눈이 멀 때: ALiBi 위치 인코딩(Positional Encodings)의 수치적 실패
요약
ALiBi 위치 인코딩이 부동 소수점 정밀도 언더플로로 인해 어텐션 가중치를 0으로 만드는 수치적 실패 모드를 분석합니다. 이 현상이 토큰 검색 능력을 저하시킴을 규명하고, 이를 완화하기 위한 네 가지 전략과 로그 스케일 거리의 효과를 제안합니다.
핵심 포인트
- ALiBi의 선형 바이어스 스케일링이 부동 소수점 언더플로를 유발함
- 수치적 실패로 인해 특정 어텐션 헤드가 정보를 식별하지 못하는 현상 발생
- 표준 벤치마크보다 토큰 검색(token retrieval) 능력에 실질적 타격
- 로그 스케일 거리 적용 시 패스키 검색 성능이 가장 일관되게 개선됨
- ALiBi 기반 모델 훈련을 위한 구체적인 완화 전략 및 권장 사항 제시
우리는 이전에 간과되었던 ALiBi 위치 인코딩(Positional Encoding)의 실패 모드를 식별했습니다. 즉, 선형 바이어스 스케일링(linear bias scaling)이 부동 소수점 정밀도(floating-point precision)의 언더플로(underflow)를 유발하여, 어텐션 가중치(attention weights)의 상당 부분을 0으로 만들고 영향을 받는 어텐션 헤드(attention heads)를 부분적으로 눈이 멀게(blind) 만듭니다. 우리는 이 실패 모드를 분석하고, 그 영향을 규명하며, 네 가지 완화 전략을 조사합니다. 나아가 ALiBi를 기반으로 하는 최첨단 사전 학습된 모델(pretrained models)에서 이 현상이 발생하는 것을 입증합니다. 148M 파라미터 디코더 모델을 사용한 포괄적인 사전 학습 실험을 통해, 문맥 외 성능 저하(out-of-context degradation)로부터 이 현상의 효과를 분리해 내는 데 도움을 얻었습니다. 우리는 ALiBi의 실패 모드가 표준 디코더 벤치마크에는 미미한 영향만을 미치는 반면, 토큰 검색(token retrieval) 능력은 실질적으로 손상시킬 수 있음을 발견했습니다. 우리는 네 가지 훈련 시점 완화 전략을 제안하고 이를 개별적 및 조합하여 평가하였으며, 로그 스케일 거리(log-scaled distances)가 패스키 검색(passkey retrieval)에서 가장 일관된 개선을 가져온다는 것을 확인했습니다. 이러한 문제에도 불구하고, 기본 ALiBi 기울기(slopes)는 특히 '건초더미 속 바늘 찾기(needle-in-a-haystack)' 검색에 있어 놀라울 정도로 강력한 베이스라인으로 남아 있습니다. 이러한 발견을 바탕으로, 우리는 ALiBi를 사용하여 모델을 훈련하는 방법에 대한 구체적인 권장 사항을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기