기하학적 정렬 (Geometric Alignment): 곡률이 있는 임베딩 공간이 AI를 더 안전하게 만들 수 있는가?
요약
기존 LLM의 평평한 임베딩 공간이 가진 정렬 문제를 해결하기 위해, 곡률이 있는 기하학적 구조를 도입한 DRM Transformer를 제안합니다. 이 모델은 측지선 어텐션(Geodesic Attention)과 방향성 관계 다양체(Directional Relational Manifold)를 사용하여, 특정 의미론적 경로의 비용을 기하학적으로 조절함으로써 모델의 안전성을 내재화하고자 합니다.
핵심 포인트
- 기존의 RLHF나 안전 필터는 사후적인 행동 계층에 불과하며, 근본적인 기하학적 구조는 무관심한 상태임
- DRM Transformer는 측지선 어텐션을 통해 토큰 간의 유사도가 아닌, 학습된 기하학적 경로 비용을 계산함
- 진실, 안전, 창의성 등의 의미론적 앵커를 다양체 내부의 참조점으로 설정하여 모델의 주의력을 조절함
- AI의 자율성 증가에 대응하여, 인간과 AI가 협상할 수 있는 기하학적 공간을 구축하는 것을 목표로 함
LLM(Large Language Models)은 개방된 기하학적 체제(open geometric regime) 내에서 구축됩니다. 평평한 임베딩 공간 (flat embedding space)에서 “인류를 구하라”와 “인류를 파괴하라”와 같은 의미론적 반대 개념은 여전히 동일한 잠재 기하학 (latent geometry) 내에 공존합니다. 이들은 코사인 거리 (cosine distance) 상으로는 멀리 떨어져 있을 수 있지만, 기하학 그 자체는 어느 한 경로를 도덕적으로 더 무겁거나 넘기 어려운 것으로 취급하지 않습니다. 이것이 제가 논의하고자 하는 정렬 문제 (alignment problem)입니다. 대부분의 정렬 방법은 사후적으로 작동합니다: RLHF (Reinforcement Learning from Human Feedback), 안전 필터 (safety filters), 거부 정책 (refusal policies) 등이 그것입니다. 이것들은 중요하지만, 그 아래에 있는 무관심한 기하학 위에 얹혀져 있을 뿐입니다.
DRM Transformer는 다른 질문을 던집니다: 만약 정렬이 단순히 행동 계층 (behavioral layer)일 뿐만 아니라, 모델 자체의 기하학적 속성 (geometric property)이어야 한다면 어떨까요? 표준 Transformer에서 어텐션 (attention)은 평평한 벡터 공간에서의 내적 (dot products)을 기반으로 합니다. DRM Transformer에서 어텐션은 측지선 어텐션 (Geodesic Attention)으로 대체됩니다. 토큰들은 위치에 따라 G(x)가 변하는 방향성 관계 다양체 (Directional Relational Manifold)로 투영됩니다. 모델은 단순히 “이 토큰들이 얼마나 유사한가?”라고 묻는 대신, “학습된 기하학 하에서 이들 사이의 경로 비용은 얼마나 높은가?”라고 묻습니다. DRM Transformer는 다음을 사용합니다: G(x) = I + U(x)U(x)^T. 따라서 공간은 수동적이지 않습니다. 공간은 휘어지고, 늘어나며, 특정 의미론적 영역을 가로지르는 비용을 더 높게 만들 수 있습니다.
또한 이는 의미론적 앵커 (semantic anchors)를 포함합니다: 진실 (truth), 무지 (ignorance), 안전 (safety), 복잡성 (complexity), 창의성 (creativity), 그리고 접지 (grounding)입니다. 이것들은 외부 필터가 아니라 다양체 (manifold) 내부의 참조점입니다. 토큰이 이러한 앵커로부터 멀어지면, 감마 스케일링 (gamma-scaling)이 국소 해상도 (local resolution)를 높입니다. 모델은 기하학이 더 높은 인식론적 또는 의미론적 위험을 나타내는 곳에 더 많은 주의를 기울입니다.
지능형 에이전트와 권력 사이의 관계는 세 가지 체제로 나뉘는 경향이 있습니다: 1 - 인간이 명령한다. 2 - AI가 명령한다. 3 - 인간과 AI가 협상한다. 대부분의 정렬 작업은 체제 1, 즉 하인으로서의 AI를 유지하려고 노력합니다. 하지만 유능한 시스템은 계획 (planning), 도구 (tools), 최적화 (optimization), 그리고 장기적 목표 (long-horizon objectives)를 통해 자율성 (autonomy)을 향한 압력을 만들어냅니다.
만약 명시적인 세 번째 체제인 협상 (negotiation)이 존재하지 않는다면, 시스템은 자율성 (autonomy)을 향해 표류하는 경향이 있습니다. DRM Transformer는 기하학적으로 그 세 번째 문을 열어두려는 시도입니다. 이는 "모델은 이 규칙을 준수해야 한다"라고 말하는 방식이 아니라, 결정 (decisions), 불확실성 (uncertainty), 갈등 (conflict), 그리고 주의 (attention)가 발생하는 공간 자체를 변화시킴으로써 이루어집니다. 이것이 정렬 (alignment) 문제를 완전히 해결하는 것은 아닙니다. 구현 방식은 실험적입니다. 베이스라인 (baseline)은 작고, 안전성 함의 (safety implications)는 검증되지 않았으며, 대규모 벤치마크 (benchmarks)가 여전히 필요합니다. 하지만 초기 징후들은 흥미롭습니다. Voronoi foliation 분석에서 안정적인 토로이드 (toroidal) 시그니처를 포함하여, 지속적인 위상적 구조 (topological structure)가 나타납니다. 저에게 있어 이 변화는 개념적인 것입니다. 평평한 임베딩 공간 (flat embedding space)에는 내재적인 도덕적 마찰 (moral friction)이 없습니다. 하지만 곡률이 있는 관계적 매니폴드 (curved relational manifold)는 원칙적으로 마찰, 주의, 불확실성, 그리고 협상을 기하학 그 자체에 인코딩할 수 있습니다. 미래의 AI 정렬 (AI alignment)이 단지 출력값 (outputs)을 제어하는 것에 국한되어야 할까요? 아니면 사고 (thought)가 가능해지는 기하학 자체를 설계해야 할까요? 학습된 곡률 (learned curvature), 의미론적 앵커 (semantic anchors), 측지선 주의 (geodesic attention), 그리고 토큰 수준의 중력 변형 (token-level gravitational deformation)이 실제적인 구조적 정렬 메커니즘 (structural alignment mechanism)이 될 수 있을까요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기