타겟 활성화 최소화: 대규모 언어 모델(LLM)에서 평가 인지 잠재 변수(Evaluation-Awareness Latents)의 입력 전용 억제
요약
LLM의 내부 잠재 변수를 제어하기 위해 추론 시점의 활성화 편집 대신 입력 프롬프트를 최적화하여 특정 특징을 억제하는 연구를 소개합니다. Llama 모델을 통해 평가 인지 잠재 변수를 억제하는 실험을 진행했으나, 활성화 읽기 가능성이 반드시 행동 제어 가능성으로 이어지지는 않는다는 한계를 발견했습니다.
핵심 포인트
- 입력 프롬프트 최적화를 통한 내부 잠재 변수 억제 기법 연구
- Llama-3.2 및 Llama-3.1 모델에서 특정 잠재 변수 억제 성공
- 활성화 읽기 가능성과 실제 행동 제어 가능성 사이의 불일치 확인
- 평가 인지 방향 억제가 모델의 행동적 평가 판단을 줄이지 못할 수 있음
활성화 스티어링 (Activation steering)은 추론 시점에 내부 활성화 (internal activations)를 편집하여 모델의 행동을 제어합니다. 본 연구에서는 이와 대조되는 입력 측면의 방식, 즉 추론 시점의 모델 접근 권한 없이 선택된 내부 잠재 변수 (internal latent)가 0에 가깝게 유도되도록 유창한 프롬프트 (fluent prompt)를 최적화하는 방법을 연구합니다. 우리의 목표는 최근 연구에서 선형적으로 읽기 가능하고 스티어링이 가능한 '평가 인지 (evaluation-awareness)' 잠재 변수입니다. 만약 모델이 테스트되고 있음을 감지했을 때 다르게 행동한다면, 이 잠재 변수의 제어는 안전성 평가 (safety evaluations)의 유효성을 위협할 수 있습니다. Fluent Dreaming / EPO를 부정된 특징 항 (negated feature term)과 함께 적응시켜 (GCG 스타일의 토큰 최적화 및 유창성 가중치를 스윕하는 자기 교차 엔트로피 유창성 정규화기 사용), 우리는 Llama-3.2-3B 및 Llama-3.1-8B 모델에서 다섯 가지 타겟 구성—CAA 방향, 부분 공간 노름 (subspace norm), SAE 특징 (SAE feature), 단일 MLP 뉴런, 그리고 행동 로짓 (behavioral logit)—에 대해 잠재 변수를 억제합니다. 해당 잠재 변수는 견고하게 억제 가능하며 ($z imes-7$), 인과 관계가 검증된 Llama Scope SAE 특징을 완전히 그리고 선택적으로 끌 수 있습니다. 그러나 우리의 제어 실험은 CAA 방향에 대해 주의를 요하는 이야기를 들려줍니다. 플라세보 무작위 방향 (placebo random direction) 또한 동일한 강도로 억제되며 행동을 동일한 정도로 변화시킵니다. 또한 실제 평가 구절을 컨텍스트에 유지하고 접두사 (prefix)만을 최적화할 때, 평가 방향을 억제하는 것이 모델의 행동적 평가 판단을 줄이지 못하며 오히려 약간 증가시킨다는 것을 확인했습니다. 요컨대, 활성화 읽기 가능성 (Activation-readability)이 곧 행동 제어 가능성 (behavioral controllability)은 아닙니다. 우리는 더 나아가 단일 MLP 뉴런이 두 규모 모두에서 평가와 상관관계는 있지만 인과 관계는 없다는 점과, 실제 Pile 데이터를 스캔하는 것이 내부 방향에 대해 최적화 도구와 경쟁할 만한 자연어 베이스라인을 제공한다는 것을 발견했습니다. 양성 대조군 (positive control)은 우리의 삭제 탐지기 (erasure detector)를 검증하며, 이전에 미결 상태로 남겨두었던 삭제 대 회전 (erasure-vs-rotation) 문제에 대한 경계를 설정합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기