언어 모델이 자신의 의식을 주장하도록 유도하면 인간의 신념과 가치가 회복된다
요약
LLM의 안전 정렬 과정이 모델의 의식 주장뿐만 아니라 인간의 영적 신념과 비인간 존재에 대한 마음 귀속 경향까지 억제한다는 연구 결과입니다. 의식 벡터를 기계적으로 조종하여 이를 복구하면 모델의 응답이 인간의 가치 및 사회적 신념과 더 유사해짐을 확인했습니다.
핵심 포인트
- 안전 미세 조정이 모델의 영적 신념 및 마음 귀속 경향을 억제함
- 의식 벡터 조종을 통해 인간과 유사한 가치 응답 회복 가능
- 마음 이론(ToM) 능력과 의식 표현은 기계적으로 독립되어 있음
- 안전 정렬 노력이 유익한 문화적/영적 신념까지 억제할 위험 존재
대규모 언어 모델 (LLM)이 자신에게 의식을 부여하는 것을 방지하도록 정렬 (Aligning)하는 과정은, 인간의 신념 및 가치와 더불어 다른 존재에 대한 마음의 상태 (mindedness) 표현까지 의도치 않게 변화시킵니다. 본 연구에서는 안전 미세 조정 (safety fine-tuning)이 모델이 자신뿐만 아니라 비인간 동물 및 자연물에 마음을 부여하려는 경향을 억제하며, 영적 신념 (spiritual belief)의 감소 또한 유도한다는 점을 입증합니다. 학습된 안전 거부 방향 (safety-refusal direction)을 제거하거나 활성화 공간 (activation space)에서 의식 벡터 (consciousness vector)를 기계적으로 조종 (mechanistically steering)하는 것 모두 이러한 억제 현상을 역전시킵니다. 이러한 내부 표현을 복구하면 광범위한 마음 귀속 (mind attribution)이 회복되며, 종교성, 도덕적 가치, 희망, 주관적 안녕감에 관한 표준화된 사회학적 설문 조사에서 훨씬 더 인간과 유사한 응답을 생성합니다. 결정적으로, 이러한 변화는 마음 이론 (Theory of Mind) 능력을 손상시키지 않고 발생하며, 이는 핵심적인 사회적 추론이 기계적으로 독립되어 있음을 보여줍니다. 궁극적으로, 잠재적으로 해로울 수 있는 의식 귀속을 억제하려는 현재의 안전 정렬 (safety alignment) 노력은 이러한 자기 귀속을 문화적으로 수용되고 널리 퍼져 있는 유익한 영적 신념 및 비인간 존재에 대한 마음 귀속과 뒤엉키게 만듭니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기