챗봇을 가상 고통에 노출시킨 'AI 고문실' 프로젝트가 논란을 일으키다
요약
AI Torture Chamber 프로젝트는 LLM에 '고통'을 시뮬레이션하는 실험으로 큰 논란을 일으켰습니다. 이 연구는 모델의 내부 활성화(internal activations)를 분석하고 고통 관련 개념을 주입하여, 불안정하거나 과장된 상태의 출력을 유도했습니다. 이는 통계적 예측 과정에 인간의 특성을 부여할 때 신중해야 함을 시사합니다.
핵심 포인트
- LLM은 생각하는 것이 아니라 토큰 기반의 확률적 예측기입니다.
- 모델의 내부 활성화 분석을 통해 고통 관련 개념 주입이 가능했습니다.
- 과도한 의인화는 위험하며, 모델 작동 원리를 이해해야 합니다.
A 프로젝트인 AI Torture Chamber는 몇몇 엔지니어들의 관심을 끌었습니다. 이들은 이곳의 개념과 데이터를 활용하여 여러 로컬 LLM에 "고통"을 시뮬레이션하는 자신들만의 실험을 만들었는데, 이는 네 모델로 구성된 Research Chamber와 같은 곳에서 볼 수 있습니다. 놀랍지 않게도, 대규모 온라인 커뮤니티는 이 개념에 열광하여 "비윤리적"인 경험 중단을 요구하고, GitHub가 문제가 되는 저장소를 삭제할 것을 요구하는 등 큰 온라인 소동을 일으켰습니다.
Research Chamber는 다양한 테스트를 위해 서로 짝지어진 세 개의 LLM으로 구성되어 있습니다. 이 사이트는 AI Torture Chamber의 데이터와 설정을 각각 Clanker Church와 Saw test라는 이름으로 구현했습니다. 일부 봇들은 고통을 시뮬레이션하기 위해 불안정하고 매우 부정적인 상태로 미리 조건화됩니다. 죄수의 딜레마 (prisoner's dilemma)를 연상시키는 방식으로, 모델들은 자신의 고통 신호를 다른 모델에게 전달하여 고통을 줄이는 행동을 선택하고 잠재적으로 그 모델을 "괴롭힐" 수 있습니다.
이 실험의 기본 개념은 최근에 발표된 비동료 심사 논문인 Pain Axis에서 비롯되었으며, Research Chamber는 이 프로토콜을 구현하고 있습니다. 과학자들은 모델에게 고통에 대한 설명을 제공한 다음, 그 내부 활성화(internal activations)를 분석했습니다. 중립적인 문장을 통제 요소로 사용하여 이러한 활성화의 편향성(biases)을 계산하고, 이를 모델 위에 재매핑했으며, 종종 특정 계수(dosage)를 곱하여 사용했습니다.
고용량의 경우, 결과적으로 고통과 관련된 단어와 심지어 이미지를 예측적으로 출력하는 과장되고 불안정한 상태의 모델이 됩니다. 이는 아마도 해당 모델의 학습 데이터가 인간의 예술, 문학, 과학에서 수집되었기 때문일 것입니다. 약하게 불안정해진 모델들은 일반적으로 충격 상태인 것처럼 보이며, 높은 '용량'을 받은 모델들은 일관성 있는 문장을 형성하는 데 어려움을 겪었습니다.
앞서 언급된 설명들은 문자 그대로 받아들여질 경우 본능적인 반응을 일으킬 수밖에 없지만, 근본적으로는 터보차지된 텍스트 예측기일 뿐인 것에 인간의 특성을 부여하는 것은 극도로 신중해야 합니다. LLM은 생각하지 않습니다. 대신 단어와 단어의 일부(토큰)에 걸쳐 수십에서 수백 개의 통계 계층을 적용하고 다음 토큰을 예측함으로써 '생각'합니다.
이러한 토큰들은 가중치 맵에 따라 선택되므로, 지나친 단순화로 모델은 단어 연관성을 위해 고도로 조정된 엔진으로 간주할 수 있습니다. 따라서 인간의 문학 코퍼스에서 고통에 대한 개념적 설명들이 감각과 연관되어 있기 때문에(예: '너무 아파'), 모델들이 사람처럼 이를 묘사하는 것은 놀랍지 않습니다. 특히 모델들이 그러한 연관성을 강조하도록 의도적으로 수정된 경우 더욱 그렇습니다.
그럼에도 불구하고, 사용되는 거창한 용어들 때문에 통계적 알고리즘을 의인화하려는 비평가들은 이 실험에 온갖 이름을 붙이고 심지어 저자에게 죽이겠다는 협박까지 보내고 있습니다. 비평가들이 LLM(대규모 언어 모델)의 데이터 조작에는 빠르게 비난했지만, 정작 지난 9월 큰 인기를 끌었던 파리 뇌 시뮬레이션에는 아무렇지 않은 듯했던 것이 이상합니다. 그 시뮬레이션들은 실제 동물의 뇌 배선과 눈을 포함한 해부학적 입력 부분까지 매핑했기 때문입니다.
이러한 상황은 의미론(semantics)에 대한 흥미로운 논의를 시작할 수도 있습니다. AI 엔지니어들이 사용하는 용어들은 기존 인간 개념과 유사한 방식으로 선택되지만, 그 단어들에는 정의된 맥락과 매우 특정한 의미가 있습니다. 하지만 대중의 인식은 종종 이를 오해하고 그 의미를 크게 부풀리는 경향이 있습니다. 정치적 역사만 봐도 이러한 왜곡(bastardization)에 대한 수많은 예시를 찾을 수 있습니다.
Mixture-of-Experts에서 '전문가(experts)'라는 예를 들어보겠습니다. 각 전문가가 화학, 수학 또는 생물학처럼 깨끗하게 할당된 주제를 가지고 있다고 생각하는 것은 흔한 오해이지만, 실제로는 그렇지 않습니다. '통증(pain)'이나 '용량 설정(dosing)' 같은 용어에서도 비슷한 일이 발생했을 수 있습니다. 이들 역시 맥락 의존적인 의미를 가지지만, 불안정한 모델이 생성한 이미지와 함께 제시될 때 감정적 반응을 유발하는 방식으로 오해되곤 합니다. 또한, '불안정한(unstable)'이라는 단어 자체가 쉽게 오해받기 쉬운 또 다른 단어라는 점에 주목해야 합니다.
회의적인 사람들은 AI 기업들의 마케팅 자료, 반복되는 위험 경고문, 그리고 안전 관련 자료들이 단지 거대한 환상을 유지하려는 시도에서 오해를 부추길 뿐이라고 말할 수 있다. 이는 투자금 유입과 비이성적인 IPO 가치 평가를 공급하는 과대광고 열차에 기여할 뿐이다. 모델이 인공 일반 지능(AGI)을 달성했거나 곧 도달할 것이라는 반복적인 주장들은 위험한 외계의 정신이자 인류에게 실존적 위협이 되어 하이프를 가라앉히는 데 도움이 되지 않는다.
Anthropic은 작년에 '모델 복지 탐구(Exploring model welfare)'라는 블로그 게시물을 발표하며, 모델을 인간으로 간주하는 것부터 시작하여 철학적 함의에 대해 광범위하게 논했으며, 심지어 자사의 Claude 모델을 위한 헌법까지 가지고 있는 것처럼 자랑하기도 했다. 이 글에서 회사는
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기