기반 모델이 훈련 데이터의 단서(cue)를 활용하여 추론하는 방식 연구
요약
본 논문은 기반 모델이 훈련 데이터의 시작 토큰 단서(cues)를 활용하여 추론하는 방식을 연구합니다. 특정 시작 단서만으로도 수학 및 코딩 분야에서 강화학습을 거친 동급 모델과 경쟁할 수 있음을 입증했습니다. 또한, 이 단서들이 추론에 미치는 영향을 인과적 데이터 개입을 통해 분석하고 안전성 측면까지 확장하여 논의합니다.
핵심 포인트
- 특정 시작 토큰 단서만으로도 기반 모델 성능이 크게 향상됨 (예: MATH-500 pass@1 42%→78%).
- RL을 통해 얻은 성능 향상의 상당 부분을 단서 고정을 통해 회복할 수 있음.
- 인과적 데이터 개입을 통해 임의의 단어를 효과적인 추론 단서로 변환 가능함.
- 토큰 단서는 모델의 은닉 상태 표현 및 안전성(거부/준수 행동)에 영향을 미침.
본 논문에서는 훈련 데이터가 기반 모델(base model) 응답 시작 부분의 토큰과 이후에 이어지는 추론 행동 사이에 어떤 연관성을 생성하는지 연구합니다. 먼저, 특정 시작 토큰 단서(cues)를 고정하는 것만으로도 기반 모델의 성능이 수학 및 코딩 분야에서 강화학습(RL) 훈련을 거친 동급 모델의 성능과 경쟁할 수 있음을 입증합니다. 예를 들어, '.
Okay'라는 단서는 Olmo-3-7B의 MATH-500 pass@1 정확도를 42%에서 78%로 높였으며, 'Alright,'는 Qwen3-14B의 경우 72%에서 87%로 높였습니다. 둘째, RL은 이러한 단서들을 더 발생하기 쉽게 만들지만, 이 단서들을 고정하면 기반 모델 대비 얻었던 성능 향상의 상당 부분을 회복할 수 있습니다. 셋째, 저희는 토큰 단서가 추론에 미치는 영향을 훈련 데이터로 역추적합니다. 임의의 단어, 예를 들어 'chicken'을 효과적인 추론 단서로 변환하거나 기존 단서의 효과를 제거하기 위해 인과적 데이터 개입(causal data interventions)을 수행했습니다. 유사한 편집을 통해 프롬프트 지시문인 'Think duck duck goose'가 추론을 유도하는 데 있어 'Think step by step'만큼 효과적임을 확인했습니다. 또한, 서로 다른 단서들이 유발하는 은닉 상태 표현(hidden state representations)이 훈련 세트의 다양한 문서 유형과 상관관계가 있음을 발견했습니다. 마지막으로, 언어 모델 안전성 분야에서 토큰 단서에 대한 연구를 확장하여 사례 연구를 수행했으며, 서로 다른 단서들이 각각 다른 거부 및 준수 행동을 유발하며 이는 훈련 데이터의 여러 유형에 대응함을 발견했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기