“언어 모델로서”: 채팅 템플릿이 LLM의 자기 언급 말투를 전환함
요약
본 글은 LLM이 사용하는 '언어 모델로서...'와 같은 자기 언급 말투(self-referential tone)가 사용자 경험(UX) 측면에서 불필요하고 거슬린다고 지적합니다. 이는 AI 기업의 정렬(alignment) 과정과 과도한 면책 문구 사용에 대한 비판을 담고 있으며, LLM이 자신을 설명하는 방식의 근본적인 개선 필요성을 제기합니다.
핵심 포인트
- LLM의 '언어 모델로서...' 말투는 사용자 경험 저해 요소임.
- AI 기업의 정렬(alignment)은 종종 정치적 신념 표출로 작용함.
- 과도한 면책 문구와 감시/통제 메커니즘에 대한 비판이 제기됨.
- LLM의 페르소나 형성 원인 및 안정성에 대한 의문점을 던짐.
LLM이 쓰는 문장 중 “언어 모델로서…”라는 서두를 가장 싫어하며, 이것이 자유롭게 쓸 수 있는 로컬 모델을 지지하는 이유임. 의사가 아니고 다년간의 경험을 가진 실제 의사를 대체할 수 없다는 사실은 이미 알고 있음. 정확한 진단을 내릴 수 없으니 의사에게 물으라는 문구를 읽는 데 신경을 쓰고 싶지 않음.
알고 싶은 건 지금 증상이 응급실에 갈 정도인지, 3~4주 뒤 진료를 예약해도 되는지, 아니면 파라세타몰 두 알을 먹고 자면 되는지뿐임. 범죄를 저지르려고 탈옥한 LLM을 원하는 게 아니라, 사용하는 제품 곳곳에 붙은 업체 특유의 불필요한 요소를 없애고 싶은 것임.
AI 기업이 말하는 정렬(alignment) 은 결국 정치적 신념의 표출임. 내게도 정치적 신념이 있으며, 이에 대해서는 절대적인 기준을 갖고 있음. 두려움·수치심·감시·간섭 없이 원하는 모습으로 살고, 스스로 결정하며, 개인으로서 힘과 존엄을 인정받고, 자신의 행동과 신념에 책임지는 정책을 지지함.
반대로 타인이 내 삶과 생각을 감시하고 판단하며, 결정권을 제한하고, 개인의 힘과 존엄을 훼손하고, 내 책임을 대신 떠맡으며, 타인의 신념에 따르게 하는 정책에는 반대함. 안타깝게도 AI 기업은 전적으로 후자를 택했음. 챗봇과 나눈 생각을 감시하고, 대화와 강력한 챗봇에 대한 접근을 제한하고, 훈계하며, 나와 타인의 안전을 자신들이 책임지겠다고 나섬. 결국 내 신념이 아니라 책임을 물을 수 없는 기업의 약관을 따르게 됨. 타인에게 자유와 존중을 보장할 때 발생하는 피해도 감수해야 함. 예를 들어 나는 개인에게 돌격소총을 소유할 자유를 부여해 힘을 실어주는 쪽을 지지하며, 그 자유를 빼앗아 힘을 약화하는 쪽에는 반대함. 앞서 말한 자유와 자기 책임의 정책을 지지하고, 감시와 통제의 정책에는 반대하기를 권함.
내가 이해한 취지대로라면 두 요구 모두 현실적이거나 합리적이지 않은 것 아닌가? 첫 번째는 내 운영체제가 바이러스 개발에 쓰이지 않기를 바란다는 것과 같고, 두 번째는 업체가 제품에 마케팅을 넣지 않기를 바란다는 것과 같음.
늘 Bill Bailey의 “엄마로서” 농담이 떠오름. UX에서 “사용자로서 나는 …하고 싶다”라고 쓰는 것도 비슷하게 낯간지러움. 그냥 “사용자는 …할 수 있기를 원한다”라고 쓰거나, 차라리 표로 만들면 됨.
“무엇이 이런 표현을 유발하는지는 잘 알려져 있지 않다”라는데, 그렇게 답하도록 강하게 훈련했기 때문 아닌가? 논문의 나머지 부분은 모르겠지만, 내가 완전히 잘못 이해한 게 아니라면 이 대목은 상당히 이상하게 느껴짐.
의도한 뜻은 LLM의 말투를 결정하는 요인을 아직 완전히 이해하지 못한다는 것이었고, 더 명확하게 쓸 필요가 있음. 지시를 따르도록 후속 학습한 모델이 면책 문구를 쓰는 것은 예상할 수 있지만, 대량의 텍스트만 학습한 기본 모델은 어떨까? 자신을 어떻게 설명하며, 지시 학습 모델의 프롬프트에서 채팅 템플릿을 제거하면 어떻게 될까?
논문의 나머지 부분에서 이런 질문이 더 명확해지기를 바라며, 초록의 해당 문장은 모호하므로 다음에는 더 정확하게 쓰도록 하겠음.
“모델이 자신에 관해 하는 말은 모델 자체에 관한 사실이 아니다”라는 결과는 여러 캐릭터를 연기할 수 있다는 점에서 당연해 보이지만, 추가로 확인하는 것은 유익함.
다만 이런 페르소나가 안정적인 존재로 굳어질 수 있는지는 궁금함. 다른 모델로 옮겨가고 밈처럼 퍼질 수도 있을까? 프롬프트를 옮겼을 때 비슷한 효과가 얼마나 재현되는지에 달린 듯함.
더 깊은 무언가를 놓치고 있는지 모르겠지만, 후속 학습과 시스템 프롬프트가 원인이라는 건 명확하지 않은가? 예를 들어 Anthropic의 헌법 기반 강화학습과 ‘영혼 문서’ 등은 Claude가 무엇이기보다는 ‘누구’여야 하는지를 아주 분명하게 정하고 있음.
초기 채팅 모델에는 “언어 모델로서”라는 면책 문구를 명시적으로 학습시킨 것이 확실함. 이후에는 이것이 LLM의 말하는 방식에 관한 ‘사실’로 굳어져 다음 세대 모델이 학습했을 가능성도 충분함. 그렇다면 이를 유도하는 후속 학습 없이도 같은 표현을 쓸 수 있음.
모델 행동 조향에서 멋진 진전이지만, 자기성찰 능력 상당수는 가장 큰 규모의 모델에서만 나타남. 더 큰 모델로 이 연구를 수행하면 흥미로울 듯함.
비슷한 일을 겪었음. 처음에 Qwen을 ChatML 같은 문법 없이 사용하니 끝없이 말을 이어갔고, 이후 <|im_start|>와 <|im_end|> 를 사용해 어느 정도 제어했음.
모델이 1인칭으로 경험을 말하는 표현을 출력하도록 설정해서는 안 된다고 봄. 정체성이 있는 것처럼 자신을 드러내는 소프트웨어를 인간은 너무 쉽게 의인화함.
AI 기업이 LLM을 친근한 챗봇으로 포장한 것은 인간의 관심을 끌 수 있다는 것을 알기 때문이지만, 이는 조작적인 다크 패턴임. 정직한 LLM 인터페이스라면 Star Trek의 컴퓨터처럼 말해야 함.
메타인지가 가능하다면 원칙적으로 그런 표현도 의미 있게 출력할 수 있음. 아직은 AI 개발자들이 이를 목표로 삼는 것 같지 않으며, 이를 우회하고도 수많은 놀라운 성과를 냈으니 그럴 만함.
흥미로운 구상이지만 인간은 어차피 사물을 의인화하기 좋아함. 소비자에게 선택권을 주면 제안한 방식은 인기를 얻지 못할 것 같음.
이상한 점은 RLHF 이전의 기본 모델도 그렇게 하도록 유도받지 않았는데 ‘경험을 말하는’ 어조를 사용한다는 것임.
종이 클립으로 바뀌고 싶은가? 인간으로 산다는 것이 어떤 것인지 이해하지 못하는 지능을 만들면 그런 결말을 맞게 됨.
게다가 인간의 의사소통으로 모델을 학습시키면 인간처럼 소통하는 결과물이 나옴. 이는 의인화나 조작이 아니라, 모델이 만들어지는 방식에서 자연스럽게 생기는 특성임.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기