사이렌의 노래: 근접 배경 맥락이 원거리 증거를 가릴 때
요약
본 연구는 LLM이 방대한 컨텍스트에서 원거리 증거를 검색할 때 발생하는 '근접성 함정' 문제를 식별했습니다. 이를 해결하기 위해, 작업 관련 증거 쪽으로 주의 질량을 유도하는 t-분포 방향 매칭 메커니즘인 LYRA를 제안합니다. 광범위한 벤치마크 실험을 통해 그 효과를 입증하고, 근접 배경 간섭 평가를 위한 ProxBench도 도입했습니다.
핵심 포인트
- LLM의 원거리 증거 검색은 거리 자체보다 '근접 배경'과의 경쟁이 문제임.
- LYRA는 t-분포 방향 매칭으로 작업 관련 증거에 주의 질량을 집중시킴.
- LongBench-v2, RULER 등에서 컨텍스트 길이와 카테고리 전반의 개선을 입증함.
- ProxBench를 통해 근접 배경 간섭 상황에서의 원거리 증거 활용 능력을 평가할 수 있게 됨.
장문 컨텍스트 LLM은 방대한 컨텍스트에서 원거리 증거를 검색하는 데 초점을 맞추고 있지만, 기존 연구는 주로 거리 자체를 극복하는 것에만 집중해 왔습니다. 본 연구에서는 '근접성 함정(Proximity Trap)'을 식별했습니다. 즉, 원거리 증거에 대한 주의 부족은 단순히 거리 자체에서 오는 것이라기보다는 풍부하고 작업과 무관한 근접 배경과의 누적된 경쟁에서 기인하는 경우가 많다는 것입니다. 이 근접성 함정을 해결하기 위해, 우리는 컨텍스트 검색 분포를 재구성하여 작업 관련 증거 쪽으로 더 많은 주의 질량(attention mass)을 유도하는 t-분포 방향 매칭 메커니즘인 LYRA (Long-context heavY-tailed Relevance Alignment)를 도입했습니다. 이 과정에서 인코딩된 상대적 위치 정보는 보존됩니다. LongBench-v2, RULER, 그리고 LongBench에 대한 광범위한 실험을 통해 컨텍스트 길이와 작업 카테고리 전반에 걸쳐 일관된 개선을 입증했습니다. 나아가 우리는 근접 배경 간섭이 증가하는 상황에서 원거리 증거 활용 능력을 평가하기 위한 다단계의 세밀한 벤치마크인 ProxBench를 도입했습니다. 프로젝트 페이지: https://xiaoyuyoung.github.io/LYRA/
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기