CACHE-UK: 금융 분야의 순차적으로 업데이트되는 양자화된 LLM을 위한 안정성 인식 메모리 편집기
요약
금융 도메인의 변화하는 정보를 반영하기 위해 4-bit 양자화된 LLM의 지식을 안정적으로 업데이트하는 CACHE-UK 프레임워크를 제안합니다. LoRA 섭동, 도메인 우선순위 모듈, 안정성 컨트롤러를 통해 양자화 모델의 성능 저하와 치명적 망각 문제를 해결합니다.
핵심 포인트
- 양자화된 LLM의 순차적 메모리 편집 시 발생하는 성능 저하 문제 해결
- rank-1 LoRA 섭동 메커니즘을 통한 저차원 어댑터 편집 제한
- 금융 도메인 우선순위 지정 및 저하 부채 추적을 통한 안정성 확보
- OpenLLaMA-3B 모델 기준 지식 저하를 11-17% 감소시킴
동적인 금융 환경에 배포된 대규모 언어 모델 (LLMs)은 시장 상황, 규제 및 기업 사실이 지속적으로 변화함에 따라 사실적 정확성을 유지해야 하는 중대한 과제에 직면해 있습니다. 4-bit 양자화 (quantization)는 효율적인 배포를 가능하게 하지만, 순차적 메모리 편집 (sequential memory editing)의 생존 가능성을 심각하게 제한합니다. 기존 방법들은 이러한 "양자화 안정성 위기 (quantization stability crisis)" 상황에서 치명적인 성능 저하를 겪습니다. 우리는 도메인 특화된 양자화 LLM을 위해 특별히 설계된 안정성 인식 메모리 편집 프레임워크인 CACHE-UK (Contextual Adaptive Continual Hybrid Editor for UK Finance)를 소개합니다. CACHE-UK는 세 가지 구성 요소를 통합합니다: 편집을 저차원 어댑터 부분 공간 (low-rank adapter subspace)으로 제한하는 rank-1 LoRA 섭동 (perturbation) 메커니즘, 콘텐츠 적응형 편집 강도를 위한 금융 도메인 우선순위 지정 모듈, 그리고 순차적 업데이트 전반에 걸쳐 치명적 망각 (catastrophic forgetting)을 방지하기 위해 "저하 부채 (degradation debt)"를 추적하는 폐쇄 루프 안정성 컨트롤러 (Stability Controller)입니다. 88,021개의 엄선된 영국 금융 코퍼스 (corpus)를 사용하여 4-bit 양자화된 OpenLLaMA-3B 모델에서 평가한 결과, CACHE-UK는 동일한 4-bit 제약 조건 하에서 조정된 베이스라인 (baselines) 대비 지식 저하를 11-17% 감소시켰으며(가장 강력한 효과), 본 설정에서 관찰된 가장 높은 테스트 성공률 (일반화) (28%, 가장 강력한 조정된 베이스라인보다 6%포인트 향상)을 달성했습니다. 이러한 결과는 안정성 인식 편집이 자원이 제한된 금융 LLM 배포에서 사실적 유지 능력을 향상시킬 수 있음을 나타내지만, 절대적인 일반화율은 여전히 낮은 수준입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기