EngramEdit: 조건부 메모리를 통한 LLM의 분리된 지식 업데이트
요약
EngramEdit은 조건부 메모리를 활용하여 LLM의 사실적 지식을 독립적으로 업데이트하는 새로운 아키텍처입니다. 이 방법은 목표 메모리 표현을 계산하고, 이를 기반으로 공유되는 n-gram 임베딩을 공동 업데이트합니다. 실험 결과, EngramEdit은 높은 편집 성공률과 함께 다단계 추론 및 CoT 프롬프팅에서 강력한 성능 향상을 입증했습니다.
핵심 포인트
- 조건부 메모리를 이용해 LLM의 지식 업데이트를 분리 가능하게 함.
- 공유 임베딩을 공동으로 업데이트하며, 관련 없는 지식 보존에 강점을 가짐.
- 다단계 추론 및 CoT 프롬프팅에서 기존 대비 높은 정확도를 달성함.
DeepSeek Engram과 같은 조건부 메모리 아키텍처는 입력 n-gram을 사용하여 학습된 임베딩을 조회함으로써, 제한적인 추가 연산으로 대규모 언어 모델(LLMs)의 용량을 확장합니다. 모델 스케일링 외에도 이 아키텍처는 사실적 지식 저장과 범용 계산을 분리할 잠재력을 보여주었으며, 트랜스포머 백본(Transformer backbone)을 고정하면서 사실적 지식을 업데이트하는 유망한 경로를 제공합니다. 이러한 잠재력을 실현하는 것은 어렵습니다. 왜냐하면 하나의 사실에 대한 여러 표현이 서로 다른 n-gram 임베딩을 활성화할 수 있고, 공유되는 임베딩을 업데이트하는 것이 의도치 않게 모델의 다른 사실 예측까지 변경시킬 수 있기 때문입니다. 우리는 조건부 메모리를 통한 분리된 지식 업데이트를 위해 EngramEdit을 제안합니다. EngramEdit은 먼저 여러 표현에 걸쳐 모델이 업데이트된 사실을 예측하도록 만드는 목표 메모리 표현(target memory representations)을 계산합니다. 그런 다음, 이 목표값에 맞추어 여러 표현과 편집 전반에 걸쳐 공유되는 n-gram 임베딩을 공동으로 업데이트하며, 관련 없는 지식을 보존하기 위해 자주 재사용되는 임베딩의 업데이트에는 더 강한 페널티를 부과합니다. 실험 결과는 EngramEdit이 조건부 메모리를 통해 독립적인 사실적 지식 업데이트를 가능하게 하며, 거의 완벽에 가까운 편집 성공률을 달성함을 보여줍니다. 수정된 지식은 보지 못한 표현과 다단계 추론(multi-hop reasoning)에서 사용 가능하며, 체인-오브-쏘트(CoT) 프롬프팅 하에서 가장 강력한 기준선보다 거의 세 배 높은 정확도를 보입니다. 사실적 업데이트가 축적되는 동안에도 관련 없는 지식과 일반적인 능력은 크게 보존됩니다. 이러한 발견들은 EngramEdit이 조건부 메모리를 편집 가능한 지식 인터페이스로 전환하여, 그 역할을 모델 스케일링을 넘어 분리된 지식 업데이트를 지원하도록 확장함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기