의료 월드 모델 (Medical World Models): 의료 AI에 필요한 것은 단순한 하네스 엔지니어링 (Harness
요약
본 글은 의료 AI 시스템 구축 시 단순히 프롬프트, 가드레일 등 외부 제어 장치(하네스 엔지니어링)만으로는 충분하지 않다고 주장합니다. 대신, 생물 의학적 추론 과정을 내부적으로 구조화하고 모델의 동작을 통제하는 '조종 가능한 생물 의학 월드 모델'이 필요하다고 강조합니다. 의료 AI는 단순한 텍스트 생성 문제를 넘어, 생물학적 상태 표현, 개입 모델링, 상태 전이 추론 등 복잡한 아키텍처를 요구하기 때문입니다.
핵심 포인트
- 의료 AI 안전성 확보를 위해 외부 제어(하네스 엔지니어링) 외에 내부적인 구조화가 필요하다.
- 하네스 엔지니어링은 모델을 프롬프트 템플릿, RAG 파이프라인, 출력 검증기 등으로 감싸 통제하는 외부 시스템 구축 방식이다.
- 의료 AI는 생물학적 상태 표현, 개입 모델링, 상태 전이 추론 등 '상태-행동-전이-피드백' 아키텍처를 필요로 한다.
- 의료 분야는 높은 리스크를 가지므로, 환자 오도, 금기 사항 무시 등의 위험을 막기 위한 강력한 외부 제어 장치가 필수적이다.
대규모 언어 모델 (LLM), RAG 시스템, AI 에이전트 (AI agents), 그리고 도구 호출 (tool-calling) 워크플로우가 의료 및 생물 의학 응용 분야에 빠르게 진입하고 있습니다. 이는 중요한 아키텍처적 질문을 제기합니다: 의료 AI의 안전성은 주로 더 나은 프롬프트 (prompts), 가드레일 (guardrails), 워크플로우 (workflows), 그리고 인간의 검토 (human review)의 문제인가? 이것들은 중요합니다. 하지만 그것만으로는 충분하지 않습니다. 이 글에서 저는 서로 관련되어 있지만 근본적으로 다른 두 가지 개념을 구분하고자 합니다:
- 하네스 엔지니어링 (Harness engineering)
- 조종 가능한 생물 의학 월드 모델 (Steerable biomedical world models)
하네스 엔지니어링은 외부에서 AI 시스템을 제어합니다. 조종 가능한 생물 의학 월드 모델은 내부에서 생물 의학적 추론을 구조화합니다. 이 차이가 중요한 이유는 의료 AI가 단순히 텍스트 생성 문제만이 아니기 때문입니다. 그것은 궁극적으로 생물학적 상태 (biological states)를 표현하고, 개입 (interventions)을 모델링하며, 가능한 상태 전이 (state transitions)에 대해 추론하고, 예상된 변화가 발생하지 않았을 때 실패를 조사하는 것에 관한 것입니다. 이를 위해서는 외부 가드레일 이상의 것이 필요합니다. 그것은 상태-행동-전이-피드백 (state-action-transition-feedback) 아키텍처를 필요로 합니다.
- 하네스 엔지니어링 (Harness engineering)이란 무엇인가?
현대 AI 엔지니어링에서 우리는 가공되지 않은 모델 (raw model)을 사용자에게 직접 노출하는 경우가 드뭅니다. 대신, 다음과 같은 제어 계층으로 모델을 감쌉니다:
- 프롬프트 템플릿 (prompt templates)
- 시스템 프롬프트 (system prompts)
- RAG 파이프라인 (RAG pipelines)
- 도구 호출 (tool calling)
- 함수 호출 (function calling)
- 워크플로우 오케스트레이션 (workflow orchestration)
- 출력 검증기 (output validators)
- 안전 필터 (safety filters)
- 규칙 엔진 (rule engines)
- 인간 참여형 검토 (human-in-the-loop review)
- 감사 로그 (audit logs)
- 샌드박스 실행 (sandbox execution)
- 권한 제어 (permission control)
이 광범위한 패턴을 하네스 엔지니어링 (harness engineering)이라고 설명할 수 있습니다. 전형적인 하네스된 AI 시스템은 다음과 같은 모습을 보일 수 있습니다:
사용자 입력 (User Input)
↓
입력 필터 / 의도 분류기 (Input Filter / Intent Classifier)
↓
프롬프트 템플릿 / 시스템 프롬프트 (Prompt Template / System Prompt)
↓
LLM / 에이전트 (LLM / Agent)
↓
도구 호출 / RAG / 외부 API (Tool Calling / RAG / External APIs)
↓
출력 검증기 (Output Validator)
↓
안전 필터 (Safety Filter)
↓
필요 시 인간 검토 (Human Review, if needed)
↓
최종 출력 (Final Output)
소프트웨어 엔지니어링에서 이는 매우 유용합니다. 예를 들어, 코드 생성 시스템은 다음과 같이 감싸질 수 있습니다:
LLM 코드 생성기 (LLM Code Generator)
↓
정적 분석 (Static Analysis)
↓
단위 테스트 (Unit Tests)
↓
타입 체커 (Type Checker)
↓
샌드박스 실행 (Sandbox Execution)
↓
인간 검토 (Human Review)
↓
병합 / 배포 (Merge / Deploy)
핵심 아이디어는 간단합니다: 우리는 모델이 완벽하게 신뢰할 수 있다고 가정하지 않습니다.
대신에, 우리는 모델의 동작을 더 통제 가능하고(controlled), 검사 가능하며(inspectable), 가역적(reversible)으로 만드는 외부 시스템을 구축합니다. 이러한 접근 방식은 AI 시스템을 안전하게 배포하는 데 필수적입니다. 하지만 의료 분야에서는 이것만으로는 충분하지 않습니다.
- 의료 AI에는 반드시 하네스 엔지니어링 (Harness Engineering)이 필요합니다
의료 AI는 다른 많은 AI 도메인보다 더 높은 리스크를 가집니다. 제대로 제약되지 않은 의료 AI 시스템은 다음과 같은 문제를 일으킬 수 있습니다:
- 환자를 오도함
- 의학적 근거를 조작함
- 진단 영역을 침범함
- 안전하지 않은 치료법을 제안함
- 금기 사항 (Contraindications)을 무시함
- 건강 교육과 의학적 조언을 혼동함
- 검사 결과를 과잉 해석함
- 효능을 과장함
- 응급 상황의 적신호 (Red flags)를 놓침
- 적절한 치료를 지연시킴
따라서 의료 AI 시스템에는 강력한 외부 제어 장치가 필요합니다. 예를 들어:
- 의료 지식 베이스 (Medical Knowledge Base)
- RAG 검색 (RAG Retrieval)
- 안전 규칙 (Safety Rules)
- 출력 검증 (Output Validation)
- 고위험 의도 탐지 (High-Risk Intent Detection)
- 임상 검토 (Clinical Review)
- 면책 조항 레이어 (Disclaimer Layer)
- 감사 로그 (Audit Logging)
- 권한 제어 (Permission Control)
기본적인 의료 AI 워크플로우는 다음과 같을 수 있습니다:
사용자 질문
↓
리스크 분류 (Risk Classification)
↓
의료 지식 검색 (Medical Knowledge Retrieval)
↓
LLM 응답 생성 (LLM Response Generation)
↓
의료 안전 검증 (Medical Safety Validation)
↓
진단 / 처방 / 응급 리스크 체크 (Diagnosis / Prescription / Emergency Risk Check)
↓
필요 시 인간 개입 (Human Escalation)
↓
최종 응답
이러한 종류의 하네스 엔지니어링 (Harness Engineering)은 필요합니다. 하지만 이는 주로 AI의 행동 리스크 (Behavior Risk)를 다룹니다. 즉, AI가 환각 (Hallucination)을 일으키고 있는가? 영역을 침범하고 있는가? 인용구를 조작하고 있는가? 안전하지 않은 조언을 하고 있는가? 제품의 경계를 위반하고 있는가? 등의 문제입니다. 이는 중요한 질문들이지만, 문제의 전부는 아닙니다. 의료 AI는 더 깊은 문제에 직면해 있습니다. 즉, 근저에 깔린 생물 의학적 추론 (Biomedical Reasoning)이 타당한가 하는 점입니다. 바로 이 지점에서 하네스 엔지니어링만으로는 부족합니다.
- 하네스(Harnessed)된 의료 AI는 의료 월드 모델 (Medical World Model)과 같지 않습니다
많은 의료 AI 에이전트 시스템은 정교해 보입니다:
- LLM
- 의료 지식 베이스 (Medical Knowledge Base)
- RAG
- 도구 호출 (Tool Calling)
- 멀티 에이전트 워크플로우 (Multi-Agent Workflow)
- 보고서 생성 (Report Generation)
- 안전 필터링 (Safety Filtering)
- 임상의 검토 (Clinician Review)
이러한 시스템들은 유용할 수 있습니다. 기록을 요약하고, 문헌을 검토하며, 의학 용어를 설명하고, 보고서를 생성하며, 가이드라인을 검색하고, 행정적 워크플로우를 지원하는 데 도움을 줄 수 있습니다.
하지만 이들이 반드시 의료 월드 모델 (Medical World Models)인 것은 아닙니다. 왜일까요? 이들은 다음과 같은 질문들에 명시적으로 답하지 못할 수도 있기 때문입니다: 1. 현재의 생물학적 상태 (Biological state)는 무엇인가? 2. 개입 (Intervention)이 하나의 행동 (Action)으로서 어떻게 표현되는가? 3. 현재 상태와 행동이 주어졌을 때, 상태가 어떻게 변할 수 있는가? 4. 대안적인 행동들은 반사실적 (Counterfactually)으로 비교했을 때 어떠한가? 5. 예상된 변화가 일어나지 않는다면, 추론의 어느 단계에서 실패했는가? 요약하자면 다음과 같습니다: 워크플로우 (Workflow) ≠ 월드 모델 (World model), RAG ≠ 상태 표현 (State representation), 에이전트 (Agent) ≠ 전이 모델 (Transition model), 가드레일 (Guardrail) ≠ 조종 가능성 (Steerability). 의료 월드 모델은 단순히 AI의 출력을 더 안전하게 만드는 것에 관한 것이 아닙니다. 이는 생물학적 상태 전이 (Biological state transitions)를 더 표현 가능하고 (Representable), 검사 가능하며 (Inspectable), 테스트 가능하고 (Testable), 수정 가능하게 (Correctable) 만드는 것에 관한 것입니다.
- 조종 가능한 생물학적 월드 모델 (Steerable biomedical world model)이란 무엇인가?
일반적인 월드 모델은 다음과 같이 표현될 수 있습니다: 현재 상태 (Current state) + 행동 (Action) → 예측되거나 가설화된 다음 상태 (Predicted or hypothesized next state). 또는: S(t), A → S(t + Δt). 여기서:
S(t)는 현재 상태
A는 행동
S(t + Δt)는 해당 행동 이후의 미래 상태입니다.
로보틱스 (Robotics)에서 이는 다음과 같을 수 있습니다: 로봇 위치 + 모터 명령 → 다음 로봇 위치.
게임 환경에서는 다음과 같을 수 있습니다: 현재 프레임 + 플레이어 행동 → 다음 프레임.
의학에서는 더 신중한 표현이 필요합니다: 현재 분자적 / 기능적 상태 (Molecular / functional state) - 개입 (Intervention) → 생물학적 상태 전이에 대한 테스트 가능한 가설 (Testable hypothesis).
이러한 구분은 중요합니다. 초기 생물학적 시스템에서 '다음 상태'는 검증된 임상 결과 예측 (Validated clinical outcome prediction)이 아니라, 일반적으로 테스트 가능한 전이 가설 (Testable transition hypothesis)로 해석되어야 합니다. 조종 가능한 생물학적 월드 모델은 다음과 같이 정의되어서는 안 됩니다: '이 모델은 어떤 치료가 효과가 있을지 예측할 수 있다.'
더 과학적으로 신중한 정의는 다음과 같습니다: '현재의 생물학적 상태, 후보 행동, 그리고 메커니즘적 제약 조건 (Mechanistic constraints)이 주어졌을 때, 모델은 상태 변화의 방향에 대해 감사 가능하고 (Auditable) 테스트 가능한 가설을 생성한다.'
다시 말해, 초기 생물 의학 월드 모델 (Biomedical World Models)은 '검증된 임상 의사 결정 시스템 (Validated Clinical Decision Systems)'이 아니라 '상태-행동-전이 가설 시스템 (State-action-transition hypothesis systems)'으로 이해하는 것이 더 적절합니다. 이는 제가 프리프린트(Preprint)인 'World Models for Biomedicine: A Steerability Framework'에서 제안한 조종 가능성 (Steerability) 프레임워크의 핵심 아이디어입니다. 이 프레임워크는 생물 의학 월드 모델이 단순히 발생 가능한 궤적을 예측하는 데 그쳐서는 안 된다고 주장합니다. 모델은 상태 표현 (State representation), 능력 정량화 (Capability quantification), 개입-반응 의미론 (Intervention-response semantics), 반사실적 전이 (Counterfactual transition), 그리고 품질 관리 (Quality-control, QC) 피드백을 통해 조종 가능성을 지원해야 합니다. 여기서 “조종 가능성 (Steerability)”은 AI 모델이 인간의 신체를 자동으로 제어하거나 임상적 판단을 대체한다는 의미가 아닙니다. 이는 모델이 상태, 행동, 전이 가설, 메커니즘 증거, 불확실성, 그리고 피드백 검사를 인간이 검토하고, 이의를 제기하며, 수정할 수 있을 만큼 충분히 명시적으로 제공한다는 것을 의미합니다.
- 하네스 엔지니어링 (Harness Engineering) vs 조종 가능한 월드 모델링 (Steerable World Modeling)
핵심적인 차이점은 다음과 같이 요약할 수 있습니다: 하네스 엔지니어링은 외부에서 AI 시스템을 제어합니다. 조종 가능한 월드 모델링은 내부에서 생물 의학적 추론을 구조화합니다. 다음은 더 상세한 비교입니다:
| 차원 (Dimension) | 하네스 엔지니어링 (Harness Engineering) | 조종 가능한 생물 의학 월드 모델 (Steerable Biomedical World Model) |
|---|---|---|
| 핵심 질문 (Core question) | 어떻게 AI 출력을 더 안전하게 만들 것인가? | 어떻게 생물학적 상태 전이를 표현하고 검사할 것인가? |
| 주요 대상 (Main object) | 모델 행동, 도구, 워크플로우, 출력 | 생물학적 상태, 개입 행동, 전이 가설, 피드백 |
| 공통 구성 요소 (Common components) | 프롬프트 (Prompt), RAG, 검증기 (Validator), 가드레일 (Guardrail), 워크플로우 | 상태 (State), 행동 (Action), 전이 (Transition), 반사실적 (Counterfactual), QC |
| 다루는 리스크 (Risk addressed) | AI 행동 리스크 | 생물 의학적 추론 리스크 |
| 실패 진단 (Failure diagnosis) | 모델이 규칙을 위반했는가? 도구가 실패했는가? | 상태가 틀렸는가? 행동 의미론이 틀렸는가? 전이 가설이 틀렸는가? |
| 엔지니어링 계층 (Engineering layer) | 외부 안전 계층 (External safety layer) | 내부 월드 모델 계층 (Internal world-model layer) |
| 의료 월드 모델링에 충분한가? | 아니오 | 예 |
| 구분 | Harness Engineering (하네스 엔지니어링) | Steerable World Model (조종 가능한 월드 모델) |
|---|---|---|
| 핵심 요구사항 (Core requirement) | 없음 | 존재 |
| 전형적인 목표 (Typical goal) | 더 안전한 출력 (Safer output) | 더 검사 가능한 생물학적 추론 (More inspectable biomedical reasoning) |
| 더 간단히 말하면 | Harness Engineering: LLM $\rightarrow$ 더 안전한 출력 | Steerable World Model: 생물학적 상태 $\rightarrow$ 행동 $\rightarrow$ 전이 가설 $\rightarrow$ 피드백 |
이들은 서로 경쟁하는 접근 방식이 아닙니다. 의료 AI에는 두 가지 모두가 필요합니다. 하지만 이들은 서로 다른 계층(layer)에서 작동합니다.
- 핵심 아키텍처: 상태-행동-전이-피드백 (state-action-transition-feedback)
월드 모델(world-model)의 동작에 접근하는 의료 AI 시스템은 단순히 다음과 같은 것 이상을 포함해야 합니다: LLM + RAG + 가드레일 (guardrails).
시스템은 최소한 다음과 같은 구성 요소를 포함해야 합니다:
- 상태 표현 (State Representation)
- 행동 표현 (Action Representation)
- 전이 추정 (Transition Estimation)
- 반사실적 추론 메커니즘 (Counterfactual Reasoning Mechanism)
- 증거 체인 (Evidence Chain)
- 품질 관리 피드백 (Quality-Control Feedback)
상위 수준의 아키텍처는 다음과 같은 형태일 수 있습니다:
환자 데이터 (Patient Data)
$\downarrow$
상태 표현 (State Representation) $S(t)$
$\downarrow$
후보 행동 표현 (Candidate Action Representation) $A$
$\downarrow$
전이 가설 추정 (Transition Hypothesis Estimation) $\hat{S}(t + \Delta t \mid A)$
$\downarrow$
메커니즘 증거 체인 (Mechanism Evidence Chain)
$\downarrow$
불확실성 / 신뢰도 (Uncertainty / Confidence)
$\downarrow$
품질 관리 피드백 (Quality-Control Feedback)
$\downarrow$
다음 반복 (Next Iteration)
주요 구성 요소를 자세히 살펴보겠습니다.
6.1 상태 표현 (State representation)
첫 번째 질문은 이것입니다: 현재의 생물학적 상태(biological state)는 무엇인가?
의학에서 이 상태는 다음과 같이 축소되어서는 안 됩니다:
- 질병 = 당뇨병 (diabetes)
- 질병 = 우울증 (depression)
- 질병 = 류마티스 관절염 (rheumatoid arthritis)
질병 레이블(label)은 표현형 수준(phenotype-level)의 설명일 뿐입니다. 이는 아직 월드 모델의 상태 공간(state space)이 아닙니다.
더 풍부한 상태 표현에는 다음과 같은 것들이 포함될 수 있습니다:
- DNA 메틸화 상태 (DNA methylation state)
- 전사체 상태 (transcriptomic state)
- 단백질체 상태 (proteomic state)
- 대사체 상태 (metabolomic state)
- 면역 상태 (immune state)
- 염증 상태 (inflammatory state)
- 장기 기능 (organ function)
- 경로 활성 (pathway activity)
- 네트워크 모듈 상태 (network module state)
- 노화 관련 모듈 상태 (aging-related module state)
- 개인별 종단적 궤적 (individual longitudinal trajectory)
예를 들어:
$S(t) = [\text{면역 모듈 상태, 미토콘드리아 모듈 상태, 대사 모듈 상태, 염증 해소 상태, 장기 기능 상태, ...}]$
이 표현은 벡터(vector), 그래프(graph), 계층 구조(hierarchy) 또는 멀티모달 임베딩(multimodal embedding) 형태가 될 수 있으며, 그 형태는 다양할 수 있습니다. 핵심 요구사항은 다음과 같습니다:
모델은 자신이 시뮬레이션하려는 생물학적 상태가 무엇인지 정의해야 합니다.
제 프리프린트(preprint)에서 설명된 Capomics / mIC-vector 프레임워크에서는, 개인을 단일한 생물학적 연령이나 위험 점수(risk score)로 나타내는 대신 모듈 수준의 내재적 능력 상태(module-level intrinsic capability states)의 조합으로 표현할 수 있습니다.
6.2 행동 표현 (Action representation)
의학에서 행동은 단순한 라벨(label)이 아닙니다.
약물 A, 운동, 영양 중재 (nutrition intervention), 수면 개선, 행동 치료
이것들은 표면적인 명칭일 뿐입니다. 월드 모델 (world model)은 행동을 생물학적 의미론 (biological semantics)의 관점에서 표현해야 합니다:
A = { target_modules, mechanism, direction, dose, timing, duration, sequence, context, uncertainty }
예를 들어, 동일한 "운동 중재 (exercise intervention)"라도 개인에 따라 서로 다른 생물학적 의미를 가질 수 있습니다:
개인 1: 인슐린 민감도 (insulin sensitivity) 개선
개인 2: 염증 부담 (inflammatory burden) 증가
개인 3: 미토콘드리아 적응 (mitochondrial adaptation) 개선
개인 4: 과도한 훈련으로 인한 회복 실패 (recovery failure) 유발
따라서 의료적 행동은 반드시 중재-반응 의미론 (intervention-response semantics) 계층으로 진입해야 합니다. 단순한 데이터베이스 라벨로 남아 있어서는 안 됩니다.
6.3 전이 추정 (Transition estimation)
월드 모델의 핵심 질문은 다음과 같습니다: 현재 상태 $S(t)$와 행동 $A$가 주어졌을 때, 상태가 어떻게 변할 것인가?
형식적으로는: $S(t), A
ightarrow ext{Ŝ}(t + ext{Δ}t ext{ | } A)$
하지만 의학에서는 이를 매우 신중하게 다루어야 합니다. 초기 시스템은 다음과 같이 주장해서는 안 됩니다:
"모델은 이 치료가 효과가 있을 것이라고 예측합니다."
더 엄격한 표현은 다음과 같습니다:
"모델은 상태 전이 (state transition)의 방향에 대해 기전적으로 제약되고 감사 가능한 (auditable) 가설을 제안합니다."
이는 다음과 같이 설명될 수 있습니다: 지식 제약적 전이 경향성 (knowledge-constrained transition tendency)
의미: 가용 가능한 생물학적 기전 (biological mechanisms), 네트워크 구조, 개인의 상태, 그리고 중재 의미론을 바탕으로, 모델은 가능한 상태 변화의 방향을 추정하며, 이는 여전히 실험적, 종단적(longitudinal) 또는 임상적 검증을 필요로 합니다. 이것이 일반적인 의료 질의응답 (medical QA)과 의료 월드 모델링 (medical world modeling) 사이의 주요 경계 중 하나입니다. 의료 QA 시스템은 다음과 같이 묻습니다: "문헌에서는 무엇이라고 말하는가?"
의료 월드 모델 (Medical World Model)은 다음과 같이 묻습니다: 만약 현재 상태가 이렇고, 이 행동 (Action)이 적용된다면, 생물학적 상태 (Biological state)는 어느 방향으로 이동할 것인가? 이 전이 가설 (Transition hypothesis)을 테스트할 수 있는가? 만약 실패한다면, 어디에서 실패가 발생할 수 있는가?
6.4 반사실적 추론 (Counterfactual reasoning)
의료 의사결정은 본질적으로 반사실적 (Counterfactual)입니다. 우리는 종종 다음과 같이 묻고 싶어 합니다: B 대신 A를 한다면 어떻게 될까? A를 B보다 먼저 순차적으로 수행한다면 어떻게 될까? 아무것도 하지 않는다면 어떻게 될까? 동일한 중재 (Intervention)를 서로 다른 기저 상태 (Baseline states)에 적용한다면 어떻게 될까? 이는 검색 (Retrieval)만으로는 해결할 수 없습니다. 월드 모델은 다음과 같은 것들을 표현할 수 있어야 합니다:
Ŝ(t + Δt | A)
Ŝ(t + Δt | B)
Ŝ(t + Δt | no intervention)
그런 다음 이러한 가능한 궤적 (Trajectories)들을 비교합니다. 현재 단계에서 이러한 비교는 검증된 개별화된 임상 결과 예측 (Validated individualized clinical outcome predictions)이 아니라, 반사실적 전이 가설 (Counterfactual transition hypotheses) 간의 비교로 이해되어야 합니다. 그 구분이 매우 중요합니다.
6.5 품질 관리 피드백 (Quality-control feedback)
의료 월드 모델은 가설을 생성할 뿐만 아니라, 실패를 점검하는 데에도 도움을 주어야 합니다. 예상된 전이가 발생하지 않는다면, 시스템은 다음과 같이 물어야 합니다:
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기