MIRROR: 모방에서 내재화로의 LLM 개인화
요약
본 논문은 LLM 개인화가 단순한 스타일 모방을 넘어 사용자 선호도 내재화로 진화해야 한다고 주장합니다. 이를 위해 MIRROR라는 새로운 자체 증류 프레임워크를 제안하며, 참조 토큰 모방을 온정책 자체 증류로 대체하여 사용자의 고유 표현과 선호도를 모델에 깊이 내재화하는 방법을 제시했습니다.
핵심 포인트
- MIRROR는 LLM 개인화를 '모방'에서 '선호도 내재화'로 전환합니다.
- 참조 토큰 모방 대신 온정책 자체 증류를 사용하여 사용자 취향을 학습합니다.
- MIRROR-F 플러그인은 정보가 풍부한 참조 토큰에 대한 선택적 지도 학습을 강화합니다.
- SFT 기반 방식 대비 치명적 망각이 적고 전반적인 개인화 성능이 우수합니다.
개인화된 LLM에 대한 수요는 스타일 모방(style imitation)에서 콘텐츠 품질로 이동하고 있습니다. 우리는 자체 증류(self-distillation)가 기존 파인튜닝 패러다임에서 이러한 격차를 메울 수 있는지 조사합니다. 이 한계를 해결하기 위해, 우리는 MIRROR(Meta-personalization by Internalizing Reference-Revealed On-policy Reflections)라는 새로운 자체 증류 프레임워크를 소개합니다. 이는 LLM 개인화를 모방에서 선호도 내재화(preference internalization)로 전환시킵니다. 첫째, 우리는 참조 토큰 모방을 참조 공개 온정책 자체 증류(reference-revealed on-policy self-distillation)로 대체하여, 모델의 다음 토큰 분포를 그 자체 생성 궤적과 참조 조건부 자체의 분포에 정렬함으로써, 참조 문구 재현이 아닌 사용자 선호도를 내재화합니다. 둘째, 우리는 MIRROR-F라는 포컬 플러그인(focal plug-in)을 도입하여, 정보가 풍부한 참조 토큰에 대한 선택적 지도 학습(selective supervision)과 온정책 분포 정렬을 증강함으로써, 사용자의 고유 표현을 보존하면서 콘텐츠 생성을 강화합니다. 세 가지 개인화 생성 벤치마크, 두 개의 모델 규모, 그리고 상호 보완적인 참조 기반 및 LLM 기반 평가를 거쳐, MIRROR와 MIRROR-F는 전반적인 최고 수준의 개인화 성능과 우수한 텍스트 품질을 달성하는 동시에, 세 가지 미지의 개인화 생성 작업에서 SFT(Supervised Fine-Tuning) 기반 기준선보다 적은 치명적 망각(catastrophic forgetting)을 보입니다. 이러한 개선점은 모델 규모와 애플리케이션 시나리오 전반에 걸쳐 일관되며, LLM 개인화 작업의 성능 향상으로 이어집니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기