AI에게 당신의 마음을 모델링하도록 가르쳤더니 당신의 선택을 예측하는 능력이 24.6포인트 향상되었습니다
요약
AI가 캐릭터의 행동을 예측할 때 물리적 사실뿐만 아니라 신념, 의도, 감정 등 '정신적 채널'을 함께 모델링하는 Mentis 파이프라인을 소개합니다. 이 방식은 기존 직접 답변 방식보다 F1 점수를 24.6포인트 향상시키며, 물리적 상태와 정신적 상태의 결합된 업데이트가 예측 성능의 핵심임을 입증했습니다.
핵심 포인트
- Mentis 파이프라인은 물리적 채널과 정신적 채널을 결합하여 세계 모델링 수행
- 정신적 채널 도입 시 기존 방식 대비 F1 점수 24.6포인트 향상
- 단순한 상태 보유보다 물리적 사건에 따른 실시간 신념 업데이트가 중요
- GPT-5.4, Opus 4.8 등 다양한 LLM에서 유사한 성능 향상 패턴 확인
AI가 당신이 무엇을 할지 추측할 때, 그것은 대개 단순한 추측일 뿐입니다
여러분은 이 수법을 전에도 본 적이 있을 것입니다. 언어 모델(Language Model)에게 이야기 속 캐릭터가 다음에 무엇을 할지 물어보면, 모델은 자신 있게 답변을 내놓습니다. 그리고 왜 그런 행동을 하는지 물어보면, 사후에 짜 맞춘 듯한 그럴싸한 정당화, 즉 이미 선택한 결과에 맞춰 역설계된 이야기를 들려줍니다. 인간의 결정을 예측하는 대부분의 시스템은 상황에서 결과로, 그리고 다시 결과에서 상황으로 패턴 매칭(Pattern-matching)을 수행하며, 보여주기식으로 "정신적(Mental)"인 부분을 채워 넣습니다.
직접적인 답변은 F1 점수 42.2를 달성합니다. 6개 샘플 자기 일관성(Self-consistency) 방식은 56.8까지 상승하지만, 이는 대부분 더 높은 확신을 가지고 동일한 추측을 하는 것에 불과합니다. 두 방식 모두 장면 속의 인물이 행동하기 전에 무엇을 알고, 무엇을 의도하며, 무엇을 느끼는지에 대해서는 묻지 않습니다.
정신적 세계 모델링(Mental World Modeling)은 다른 접근 방식을 제안합니다. 믿음, 의도, 감정, 그리고 규범을 첫 번째 파싱(Parsing) 단계부터 물리적 사실과 나란히 존재하는 상태 변수(State variables)로 취급하는 것입니다. Mentis 파이프라인은 장면을 파싱하는 것부터 다음에 일어날 일을 시뮬레이션하고 어떤 행동이 적합한지 점수를 매기는 모든 단계에 걸쳐 물리적 채널(Physical channel)과 정신적 채널(Mental channel)을 결합된 상태로 유지합니다. 전체 과정을 실행했을 때, 테스트된 8개의 LLM 평균 F1 점수는 66.8에 도달하며, 이는 직접 답변 방식보다 24.6포인트, 자기 일관성 방식보다 10.0포인트 높은 수치입니다. 진짜 질문은 이러한 마음 추적(Mind-tracking)이 어디에서 이득을 얻는지, 그리고 어디까지가 물리적 사실만으로 수행되었던 작업인지에 대한 것입니다.
모든 결정 뒤에 있는 두 가지 채널
물리적 채널은 객체, 캐릭터, 공간 관계, 환경 — 즉 사물이 어디에 있는지, 방 안에 누가 있는지, 무엇이 무엇에 닿아 있는지 등을 추적합니다. 모든 세계 모델(World model)은 이미 이 작업을 처리하고 있습니다.
정신적 채널(Mental channel)은 신념(캐릭터가 무엇을 사실이라고 생각하는지), 의도(그들이 무엇을 하려고 하는지), 감정, 성향, 규범 및 제약 조건을 보유합니다. Mentis는 이를 캐릭터별로 나타냅니다. 즉, 각 개인은 자신만의 신념과 목표를 가지고 있습니다. 행동은 두 채널 모두에서 동시에 발생합니다. 캐릭터의 다음 움직임은 물체가 어디에 있는지(물리적 상태)와 그 물체가 어디에 있다고 믿는지(정신적 상태) 모두에 달려 있으며, 어떤 사건이 발생했을 때 이 두 가지 사실은 함께 업데이트되어야 합니다.
절제 실험(Ablation) 수치는 이러한 결합(Coupling) 논거를 구체화합니다. 정신적 채널을 완전히 제거하면 12.1 F1 포인트가 손실됩니다. 물리적 채널을 제거하면 16.5 포인트가 손실됩니다. 하지만 두 채널을 유지하면서 이들을 분리(Decoupling, 물리적 상태와 정신적 상태가 독립적으로 업데이트되도록 함)할 경우 손실은 6.4 포인트에 불과합니다. 만약 정신적 계층의 가치가 단순히 존재하는 것 자체에서 온다면, 분리하는 것이 제거하는 것만큼이나 큰 타격을 주어야 합니다. 하지만 그렇지 않습니다. 완전한 제거와 분리 사이의 추가적인 손실은 바로 상호작용 그 자체, 즉 물리적 사건과 발맞추어 이루어지는 신념 업데이트(Belief updating)에서 발생합니다.
GPT-5.4, Opus 4.8, Fable 5 모두 동일한 패턴을 보였으나 그 정도는 달랐습니다. 분리로 인한 손실은 각각 4.2에서 7.4 포인트 사이였습니다.
물리적 채널과 정신적 채널을 결합된 상태로 유지함으로써, 독립적인 시뮬레이션이 상실하는 6.4 F1 포인트를 보존할 수 있습니다. 가치는 단순히 채널들이 존재하는 것이 아니라, 채널 간의 상호작용에서 발생합니다.
왜 다음에 일어날 일을 시뮬레이션하는 것이 마음을 읽는 것보다 중요한가
의사결정-예측 파이프라인 (decision-prediction pipeline)이 어디에서 무너지는지 찾으려면, 각 단계마다 올바른 정답을 하나씩 제공하고 점수 상승분을 측정하십시오. 이것은 파이프라인이 여전히 작동 중인 상태에서 실행할 수 있는 부검 (autopsy)에 가장 가까운 방법입니다.
오라클 테스트 (oracle test)는 잘못된 추측이 하류의 모든 과정을 오염시키는 네 가지 체크포인트를 타격합니다: 현재 상태 파싱 (parsing the current state), 대상의 관찰 (observation) 생성, 행동 이후에 일어날 일의 시뮬레이션 (simulating what happens after an action), 그리고 결과적인 분기들의 점수 산정 (scoring the resulting branches). 각 단계에 개별적으로 골드 데이터 (gold data)를 교체 투입하고 F1 상승분을 측정하십시오.
가장 눈에 띄는 것은 골드 후속 상태 (gold successor states)입니다. 이는 각 후보 행동 이후의 세상이 어떻게 보이는지를 시뮬레이션하는 단계로, +3.5 F1의 상승을 보였습니다. 이는 네 단계 중 가장 큰 단일 단계 상승폭이며, 다른 단계들과는 비교조차 되지 않습니다. 나머지 세 번의 교체는 각각 눈에 띄게 적은 이득을 가져왔습니다.
네 가지 상승분을 모두 더하면 +8.7 F1입니다. 이제 모델에 네 단계 모두에서 동시에 골드 데이터를 제공하면 +6.3 F1이 됩니다. "개별 수정의 합"과 "결합된 수정" 사이의 2.4포인트 격차는 가시화된 오차 전파 (error propagation)입니다. 잘못된 현재 상태 파싱과 잘못된 관찰이 겹칠 때, 단계를 개별적으로 수정하면 동일한 근본적 실수가 두 번 계산되지만, 함께 수정하면 한 번만 계산됩니다.
실험을 더 밀어붙여 보겠습니다: 전체 시스템에 모든 단계에서 골드 중간값 (gold intermediates)을 제공하면 97.0 F1에 도달합니다. 인간 참조 한계치 (human reference ceiling)는 98.5 F1이며, 남은 1.5 F1의 격차는 전적으로 마지막 가치 평가 단계, 즉 어떤 분기가 적합한지에 대한 판단 단계에 머물러 있습니다.
만약 당신이 사람이 무엇을 할지 예측하는 시스템을 구축하고 있다면, 그들의 신념(beliefs), 욕구(wants), 그리고 주변 상황에 대한 사회적 파악(social read)에 대한 더 풍부한 분류 체계(taxonomy)를 구축하는 데 투자하고 싶은 유혹을 느낄 것입니다. 하지만 이 수치들에 따르면, 더 큰 보상은 그들이 행동한 직후의 세상이 어떻게 보이는지를 정확하게 시뮬레이션하는 것입니다. 그 단계가 가장 큰 비중을 차지하며, 다른 모든 수정 사항은 그 단계에 달려 있습니다.
각 단계를 하나씩 수정하면 +8.7 F1의 향상을 약속하지만, 이들을 함께 수정하면 +6.3을 달성합니다. 누락된 2.4포인트는 하나 이상의 단계에서 나타나는 동일한 근본적 오류들 때문입니다.
어떤 결정은 다른 결정보다 예측하기 쉽다
결정 유형별로 결과를 나누어 보면 그 차이가 극명합니다. 대인 관계 결정(interpersonal decisions)은 71.3 F1을 기록했고, 사물 및 자원 결정(object and resource decisions)은 66.2에 머물렀으며, 공간 및 지각 결정(spatial and perceptual decisions)은 61.3으로 떨어졌고, 위험 또는 규범 결정(risk or norm decisions)은 59.6을 기록했습니다.
장면의 78%가 두 명 이상의 등장인물을 포함하므로, "올바른" 행동을 예측한다는 것은 대개 한 사람이 다른 사람에 대해 무엇을 믿고 있는지를 예측하는 것을 의미합니다. 대인 관계 장면(Interpersonal scenes)은 믿음과 의도라는 숨겨진 계층이 가장 활발하게 작동하는 곳이며, 물리적-정신적 파이프라인(physical-mental pipeline)이 가장 크게 앞서 나가는 지점이기도 합니다. 위험 및 규범 결정(Risk and norm decisions)은 불확실성 하에서의 수용 가능한 행동에 대한 판단(judgment calls)에 달려 있으며, 이는 신호가 더 미약하고, 가치 평가가 더 어려우며, 성능의 한계치(ceiling)가 더 낮습니다. 71.3과 59.6 사이의 격차는 장면의 결과가 테이블 위에 놓인 물리적 상황보다 누군가의 머릿속에 있는 내용에 얼마나 의존하는지를 보여줍니다.
모달리티(modality)별 분석도 이와 관련된 이야기를 들려주지만, 논문에서는 데이터 서브셋이 작기 때문에 이를 방향성을 나타내는 읽기(directional reads)로 표시했습니다. 텍스트 기록(320개)은 68.1 F1을 기록했고, 이미지(100개)는 66.2에 도달했으며, 비디오(28개 기록)는 62.1로 떨어졌습니다. 텍스트와 정지 영상은 추론할 수 있는 고정된 프레임을 제공합니다. 비디오는 다릅니다. 장면이 시간에 따라 전개되므로, 시스템은 세상이 변함에 따라 각 순간에 캐릭터가 볼 수 있었던 것을 끊임없이 재구성해야 합니다. 모든 프레임은 필터링된 시각(filtered view)이 캐릭터가 인지할 내용으로부터 벗어날 수 있는 또 다른 기회를 추가합니다. 텍스트는 정지해 있지만, 비디오는 계속 움직입니다.
시스템이 여전히 틀리는 부분
F1 수치를 신뢰하기 전에, 파이프라인이 매번 사용 가능한 답을 생성하는지 확인해야 합니다. 현재 상태에 대한 아티팩트(Artifact) 존재 여부는 94.6%의 확률로 확인되었습니다. 6개의 후보 행동이 모두 시뮬레이션되었음을 의미하는 분기 스키마 커버리지(Branch schema coverage)는 89.7%를 유지했습니다. 옵션 전용 하한선(options-only floor)은 8개 모델 전체에서 29.7~33.2% 사이에 위치하며, 이는 무작위 추측 확률인 16.7%보다 높습니다. 또한 추측 모델이 얼마나 강력하든 상관없이 평탄한 수치를 보입니다. 논문은 이 평탄한 수치를 모델이 이용할 수 있는 지름길이 아니라, 의미론적 타당성 하한선(semantic-plausibility floor, 즉 일부 잘못된 옵션은 단순히 정상적인 다음 행동처럼 들리지 않음)으로 해석합니다. 우리가 주목해야 할 추론 격차(reasoning gap)는 해당 ~31%의 하한선에서 전체 시스템의 66.8까지의 거리입니다.
하지만 5.4%의 경우, 현재 상태의 파싱 (parse)이 흔적을 남기지 않는데, 이는 다운스트림 (downstream)의 무언가가 검증 불가능한 상태를 기준으로 분기 (branches)들을 평가하고 있음을 의미합니다. 대략 10개 중 1개의 레코드는 전체 옵션 세트를 시뮬레이션하는 과정을 건너뜁니다. 그다음으로는 8.0%의 관점 누출 (perspective leakage) 문제가 있습니다. 파이프라인 (pipeline)이 캐릭터의 관찰 내용을 구축하면서, 해당 캐릭터가 알 방법이 없는 사실, 즉 다른 방의 세부 사항이나 다른 캐릭터의 사적인 생각, 혹은 시야 밖에 있는 무언가를 슬쩍 끼워 넣는 것입니다. 이는 인식론적 접근 실패 (epistemic access failure)입니다. 전체 시스템이 각 캐릭터가 인지할 수 있는 것을 바탕으로 그들이 무엇을 믿는지 추적하도록 구축되었을 때, 이 문제는 12개 레코드 중 1개꼴로 나타납니다.
여기에 3.2%의 완전한 실패율 (스키마에 유효한 출력을 생성하지 못하는 레코드)을 더하면, 강력한 벤치마크 수치와 실제로 배포할 만한 수준 사이의 거리를 더 명확하게 읽을 수 있습니다. 66.8의 평균 F1 점수는 견고하게 들리지만, 약 20번의 실행 중 1번꼴로 구조적 오류를 일으키고, 12번 중 거의 1번꼴로 관여해서는 안 될 정보를 누출하는 파이프라인 위에 놓여 있다는 점을 기억하면 이야기가 달라집니다.
그렇다면 AI는 다음에 무엇을 모델링해야 하는가?
두 가지 숫자가 가장 중요합니다. 골드 후속 상태 (Gold successor states)는 단일 오라클 이득 (oracle gain) 중 가장 큰 +3.5 F1을 가져다주며, 이는 어디에 투자해야 할지를 나타냅니다. 그리고 4개 단계가 모두 함께 수정될 때, 약속된 8.7포인트 중 2.4포인트가 증발하는데, 이는 오류가 깔끔하게 합산되는 대신 단계 전반에 걸쳐 중첩되기 때문입니다. 수정 사항은 복리로 작용하며, 체인의 앞부분에서 수정할수록 그 가치는 더 커집니다.
따라서 엔지니어링 예산은 그곳에 투입되어야 합니다: 결과 (consequences)를 시뮬레이션하는 능력을 개선하는 것 말입니다. 믿음 모델 (belief model)은 완벽하게 수행하지만 후속 상태 (successor state)를 망치는 시스템은 여전히 잘못된 행동을 전달할 것입니다. 왜냐하면 평가 (scoring) 단계가 애초에 정확하게 투영되지 않은 분기들을 판단하게 되기 때문입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기