언어 모델 추론을 위한 선택적 상태 공간 적응 및 검색
요약
기존 LoRA의 정적인 업데이트 한계를 극복하기 위해 토큰 및 컨텍스트 수준에서 동적 상태를 반영하는 새로운 어댑터 제품군을 제안합니다. MaLoRA와 MaRA를 통해 언어 모델의 추론 정확도를 크게 향상시켰습니다.
핵심 포인트
- MaLoRA: 토큰 간 재귀적 상태를 활용한 동적 스케일링 인자 도입
- MaRA: 세그먼트 간 상태를 추적하여 관련성 높은 컨텍스트 검색
- Qwen, Llama, Gemma 등 다양한 백본 모델에서 성능 검증
- LoRA 대비 평균 6.8 F1 점수 향상 및 추론 능력 개선
저차원 적응 (Low-rank adaptation)은 모든 입력에 동일하게 적용되는 정적인 학습 업데이트를 도입합니다. 이 업데이트는 작업 수준의 적응 (task-level adaptation)을 제공하지만, 토큰 수준 (token-level) 또는 인스턴스 수준 (instance-level)의 상태 변화를 명시적으로 나타내지는 않습니다. 두 가지 상호 보완적인 입도 (granularities)에서 선택적 상태 공간 재귀 (selective state-space recurrence)를 도입하는 어댑터 제품군이 제안되었습니다. 토큰 수준에서, extbf{MaLoRA} (Mamba-modulated low-rank adaptation)는 이전 연구의 상태가 없는 변조기 (stateless modulators)와 대조적으로, 어댑터의 스케일링 인자 (scaling factor)를 토큰 간의 재귀적 상태를 가진 동적인 입력 의존 함수로 만듭니다. 컨텍스트 수준에서, extbf{MaRA} (Mamba Retrieval Adapter)는 변조된 언어 모델이 답변을 생성하기 전에, 세그먼트 간 상태 (cross-segment state)를 추적하고 쿼리와 가장 관련이 깊은 세그먼트를 선택합니다. 세 가지 동결된 백본 (Qwen-2.5-7B, Llama-3.1-8B, Gemma-2-9B)과 두 가지 추론 벤치마크 (MuSiQue, 2WikiMultihopQA)에 걸쳐, 이 제품군은 $3{ imes}2$ 그리드의 모든 셀에서 추론 정확도를 향상시켰습니다. LoRA 베이스라인 대비 평균 $+6.8$ F1 ($+10.5%$ 상대적) 향상, 가장 어려운 셀에서는 최대 $+9.3$ F1 ($+18.2%$ 상대적) 향상을 기록했으며, 이러한 토큰 수준의 이득은 길이 스트레스 하의 RULER QA-2에서도 유지되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기