NVIDIA의 훌륭한 논문
요약
이 논문은 RAG와 긴 컨텍스트 처리가 별개의 난제가 아니며, LLM 자체의 내부 표현을 활용하여 두 영역 모두에서 개선할 수 있음을 주장합니다. 백본 모델에 소수의 파라미터만 추가하는 방식으로 기존 검색기-리랭커 스택과 장거리 의존성 문제를 동시에 해결했습니다.
핵심 포인트
- RAG와 긴 컨텍스트 처리는 분리된 문제가 아니다.
- LLM 내부 표현을 활용하여 외부 검색기를 대체한다.
- 적은 파라미터 추가만으로 성능이 크게 향상되었다.
- 긴 컨텍스트에서 방해 요소를 가지치기(pruning)하여 효율성을 높였다.
지난 몇 년 동안 우리는 RAG와 긴 컨텍스트를 완전히 별개의 엔지니어링 난제처럼 다루어 왔습니다.
하나는 바이-인코더(bi-encoders)와 리랭커(rerankers)로 구성된 외부 파이프라인이고, 다른 하나는 비용이 많이 드는 무차별 대입 어텐션 문제입니다.
이 논문은 이러한 분리가 대부분 인위적이라는 매우 설득력 있는 주장을 펼칩니다.
외부 검색기(retrievers)를 단순히 붙이는 대신, 그들은 LLM 자체의 내부 표현을 활용하여 두 가지 영역 모두에서 증거를 선택합니다.
가장 놀라운 점은 백본(backbone)이 완전히 고정되어 있다는 것입니다.
그들은 단지 약 50만 개의 학습 가능한 파라미터만을 추가했습니다.
방대한 3B 토큰의 위키피디아 인덱스에서, 이 작은 수정만으로도 기존의 밀집(dense) 및 하이브리드 검색기-리랭커 스택을 전반적으로 능가합니다 (HotpotQA 재현율이 49%에서 73%로, 2Wiki는 31%에서 60%로 증가).
하지만 다른 방향으로 '건초 더미 속의 바늘' 문제도 해결합니다.
긴 컨텍스트 벤치마크에서, 동일한 내부 메커니즘을 사용하여 생성 전에 방해 요소를 적극적으로 가지치기(prune)함으로써, 128k 컨텍스트에서의 NoLiMA 정확도를 거의 1%에 머물던 것에서 거의 25%까지 끌어올립니다.
초반에 불필요한 내용을 제거하기 때문에, 32k 토큰을 넘어서도 FLOPs와 첫 토큰까지 걸리는 시간이 폭발적으로 증가하는 것을 지켜보는 대신 엄청난 감소를 얻습니다.
Edan Kinderman과 팀의 멋진 작업입니다.
전체 논문은 여기에서 읽어보세요: https://t.co/tNREGwtKZP
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: RAG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기