반복적 영공사영을 통한 페르소나 부분 공간 추출 및 조절
요약
본 논문은 대규모 언어 모델(LLMs)의 페르소나 제어를 위해 '조절(modulation)'이라는 새로운 개념을 제시합니다. 기존 방법들이 단일 방향으로 축소하는 한계를 극복하기 위해, 반복적 영공사영(INLP)을 사용하여 잠재 공간에서 다차원 부분 공간을 추출하고 이를 통해 LLM의 페르소나를 정밀하게 제어할 수 있음을 입증했습니다.
핵심 포인트
- 반복적 영공사영(INLP)으로 다차원 페르소나 부분 공간 추출
- 기존 방법 대비 더 강력하고 해석 가능한 페르소나 조절 가능
- 작업 성능을 유지하며 LLM의 행동 제어 프레임워크 제공
대규모 언어 모델(LLMs)은 사용자와 작업에 따라 의미론, 전문성, 관점을 조정하기 위해 뚜렷한 페르소나를 채택할 수 있습니다. 이러한 특성에 대한 정밀한 제어는 모델 동작의 안전성과 신뢰성을 보장하는 데 매우 중요합니다. 활성화 스티어링(activation steering)이나 프롬프트 기반 페르소나 유도와 같은 기존 방법들은 페르소나를 단일 지배 방향으로 축소하여, 그 지배적인 신호가 제거된 후에만 나타나는 미묘하고 중첩된 특성들을 놓치고 있습니다. 우리는 페르소나 컨텍스트가 조작되는 콘텐츠 자체에 이미 임베딩되어 있는 설정을 '조절(modulation)'로 소개합니다. 이는 제어 방법이 처음부터 주입하는 것이 아니라, 이미 존재하는 특성을 증폭시키거나 억제할 것을 요구합니다. PaSS는 지도 학습 기반의 대조 예시 없이 페르소나를 모델의 잠재 공간 내 다차원 부분 공간으로 모델링하는 추론 시간(inference-time) 제어 패러다임입니다. 이 페르소나 부분 공간들은 반복적인 개념 지우기(iterative concept erasure)를 통해 추출되며, 재학습 없이 페르소나 기반 생성에 적용되어 조절됩니다. 이 부분 공간을 추출하기 위해, 우리는 반복적 영공사영(Iterative Nullspace Projections, INLP)을 사용하여 페르소나 특정 방향들을 선형적이고 반복적으로 분리합니다. 우리는 MATH-500, TinyAlpaca, GSM8K, IFEval과 같은 다양한 작업을 대상으로 6가지 페르소나에 대해 인과적 평가를 수행했으며, 구별적인(discriminative) 반복적 부분 공간 추출이 주어진 페르소나의 근저에 있는 다양한 특성을 포착하여, 단일 방향의 가산 방식 방법보다 더 강력하고 큰 조절을 가능하게 함과 동시에 콘텐츠 충실도를 유지함을 보여주었습니다. 나아가 우리는 각 부분 공간 내 개별적으로 분리된(peeled) 방향들을 연구하여, 그들이 인코딩하는 페르소나 행동의 뚜렷한 측면들을 밝혀냈습니다. 전반적으로, 우리는 페르소나 부분 공간이 작업 성능을 희생하지 않으면서 LLM 동작을 조절할 수 있는 제어 가능하고 해석 가능하며 일반화 가능한 프레임워크를 제공함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기