LocUS: 목표 활성화 조향을 위한 헤드 선택 및 부분 공간 투영
요약
LocUS는 LLM의 활성화 조향(Activation steering) 기법의 한계를 개선한 방법론입니다. 기존 방식이 전체 표현 공간에 개입하여 원치 않는 능력 저하를 초래하는 문제를 해결하기 위해, LocUS는 모델 출력 어휘 부분 공간과 희소한 어텐션 헤드에 국지화된 조향 변환을 제안합니다.
핵심 포인트
- LocUS는 활성화 조향의 한계를 개선하여 일반 능력 저하를 방지합니다.
- 출력 어휘 부분 공간 및 희소 어텐션 헤드를 활용해 개입을 국지화했습니다.
- 최신 기술 기반과 동등하거나 우수한 성능을 보이며, 파라미터 개입이 적습니다.
활성화 조향(Activation steering)은 추론 시간(inference time)에 대규모 언어 모델(LLM)을 제어하는 강력한 훈련 불필요 패러다임입니다. 하지만 표준 접근 방식들은 대비 데이터(contrastive data)로부터 레이어별 조향 방향을 추정하고, 이를 해당 레이어의 전체 표현 공간에 적용합니다. 이 과정은 개입을 대비 데이터에 존재하는 목표 외 속성(off-target properties)과 결합시킬 수 있으며 관련 없는 능력을 저하시킬 수 있습니다. 이러한 문제를 완화하기 위해, 우리는 LocUS (Localized Unembedding Steering)를 소개합니다. 이는 활성화 조향을 모델 자체의 출력 어휘 부분 공간(output vocabulary subspace)에 기반하는 방법입니다. LocUS는 언임베딩 행렬(unembedding matrix) 내에서 속성별 선형 부분 공간(property-specific linear subspace)을 식별함으로써, 조향 변환이 특정 부분 공간으로 제한되는 기하학적 제약(geometric constraint)을 강제하고 동시에 그 적용을 희소한 어텐션 헤드(attention heads)의 하위 집합에 국지화합니다. 독성 완화, 감정 재지향, 아첨 방지 등 세 가지 모델 계열에 걸친 광범위한 평가 결과는 LocUS가 6% 미만의 파라미터만 개입하면서도 최신 기술 기반(state-of-the-art baselines)과 동등하거나 더 나은 성능을 보이며 일반 능력을 더 잘 보존함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기