망각이 치명적이지 않을 때: 가짜 망각의 메커니즘에 대하여
요약
본 논문은 언어 모델의 파인튜닝 과정에서 발생하는 '가짜 망각(spurious forgetting)' 현상을 분석합니다. 지식 손실이 항상 영구적이지 않으며, 일부는 회복될 수 있음을 밝힙니다. 이러한 역동성은 최소 연관 기억 구조와 정규화 과정을 통해 재현 가능하며, 망각의 메커니즘을 이해하는 것이 중요하다고 제안합니다.
핵심 포인트
- 망각은 항상 영구적이지 않으며 '가짜 망각'일 수 있다.
- 최소 연관 기억과 네트워크 정규화가 지식 변화 역동성을 설명한다.
- 파인튜닝 과정에서 오래된 사실의 상대적 기하학 구조는 보존된다.
- 진정한 망각은 개별 사실들의 느린 침식(erosion)에 의해 발생한다.
언어 모델이 파인튜닝(finetuning) 과정에서 잊는 것으로 보이는 지식은 종종 저장되어 있다가 회복될 수 있으며, 이는 '가짜 망각(spurious forgetting)'이라 불리는 현상입니다. 새로운 사실로 파인튜닝하는 것은 심지어 스스로 되돌리는 망각을 초래할 수 있습니다: 오래된 사실의 회상이 무너졌다가, 새로운 사실만으로 훈련이 계속됨에 따라 복구되고, 그 후에야 비로소 영구적으로 소실됩니다. 우리는 이러한 망각이 언제 치명적이지 않은지 이해하고자 합니다. 최소 연관 기억(minimal associative memory)은 공유된 구조를 가진 키(keys), 집중된 새로운 값(concentrated new values), 그리고 네트워크의 정규화(normalization)라는 세 가지 요소로 이 역동성을 재현합니다. 파인튜닝은 모든 오래된 표현들을 공통 방향으로 이동시키면서, 오래된 사실들은 숨기지만 그 상대적 기하학 구조는 보존합니다; 정규화는 새로운 사실들이 학습된 후 이 이동을 철회하는 반면, 사실별 변화가 누적되어 침식(erosion)을 유발합니다. 더욱이, 공통적인 이동분을 빼주는 것은 합성 데이터로 훈련된 트랜스포머(Transformer)의 붕괴를 제거하며, 각 가중치 업데이트에서 단일 방향을 제거하는 것은 사전 학습된 언어 모델에서 오래된 사실들을 복원시킵니다. 따라서 망각은 공유되고 되돌릴 수 있는 접근성의 손실과 개별 사실들의 느린 침식(erosion)이 결합된 것이며, 오직 후자만이 치명적입니다. 어느 쪽이 지배적인지는 새로운 데이터가 오래된 기억들을 함께 이동시키는지 아니면 떨어지게 하는지에 따라 달라집니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기