대규모 언어 모델(LLM)은 컨텍스트 내에서 믿음 상태 기하학을 발전시킨다
요약
본 연구는 대규모 언어 모델(LLM)이 컨텍스트 내 학습(ICL) 능력을 보이지만, 그 표현 메커니즘을 이해하기 어렵다는 점에 주목했습니다. 연구진은 HMM 데이터를 사용하여 LLMs의 은닉 상태를 탐지하고, 이 믿음 상태가 잔여 스트림 활성화로부터 선형적으로 디코딩 가능함을 입증했습니다. 이는 ICL이 컨텍스트 기반 최적 베이즈 예측을 근사한다는 강력한 증거를 제시합니다.
핵심 포인트
- LLM의 ICL 능력을 HMM 은닉 상태와 연결하여 분석함.
- 믿음 상태가 LLM 활성화로부터 선형적으로 디코딩 가능함을 발견함 (R² 0.83-0.99).
- 탐지된 부분 공간에 개입(patching/steering)했을 때 모델 성능이 유지됨을 입증함.
- ICL이 컨텍스트 기반 최적 베이즈 예측을 근사한다는 이론적 증거를 제공함.
다음 토큰 예측으로 훈련된 대규모 언어 모델(LLMs)은 놀라운 컨텍스트 내 학습(ICL) 능력을 보여주지만, ICL을 뒷받침하는 표현은 여전히 이해하기 어렵습니다. 우리는 통제된 환경에서 이러한 표현을 고려합니다: 은닉 마르코프 모델(HMMs)에서 방출된 데이터로 LLMs에 프롬프트를 제공하고, 관찰된 토큰 히스토리에 대한 HMM의 은닉 상태에 대한 사후 분포인 해당 믿음 상태를 탐지합니다. 비자명한 믿음 구조를 위해 선택된 40개의 HMM 데이터로 프롬프트가 지정된 6개의 오픈 소스 LLM에 걸쳐, 우리는 믿음 상태가 잔여 스트림 활성화(residual stream activations)로부터 선형적으로 디코딩 가능하며, 초기 레이어부터 후기 레이어까지 HMM 및 LLM 조합 전반에 걸쳐 최대 탐지 $R^2$ 값이 0.83-0.99임을 발견했습니다. 기능적 관련성을 확립하기 위해, 우리는 패치(patching)와 스티어링(steering)을 통해 탐지된 부분 공간에 직접 개입하고, 그 결과로 교란되지 않은 모델과 유사한 수준의 다운스트림 예측 품질을 얻었으며, 대조군에서는 성능이 크게 저하되었습니다. 종합적으로, 이러한 결과는 오픈 소스 LLM에서의 ICL이 컨텍스트에서 추론된 생성 모델에 대한 최적 베이즈 예측을 근사한다는 표현 수준의 증거를 제공합니다. 더 광범위하게, 우리의 발견은 입력 분포 구조와 활성화 기하학을 연결하는 이전 결과를 확장합니다: HMM 데이터로 명시적으로 훈련된 장난감 네트워크부터 프로덕션 규모의 LLMs까지입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기