
GPT 5.6 Sol Ultra를 활용한 Codex는 강력한 성능을 발휘하며, 이렇게 이른 시기에 불가능할 것이라 생각했던 일들을 해내고
요약
기계론적 해석 가능성(mechanistic interpretability) 연구를 돕기 위해 Codex와 GPT 5.6 Sol Ultra를 활용하여 구축한 CORTEX 도구를 소개합니다. CORTEX는 로컬 환경에서 모델의 내부 동작을 시각화하고 실험할 수 있는 네이티브 Windows 애플리케이션입니다.
핵심 포인트
- CORTEX는 토큰 확률, 로짓 렌즈, 어텐션 맵 등을 시각화하는 도구입니다.
- 로컬 IPC를 통해 Python/PyTorch 백엔드와 연결되어 오프라인으로 작동합니다.
- 활성화 패칭 및 어텐션 헤드 절제 등 인과적 실험 기능을 지원합니다.
- 현재 GPT-2 및 Llama 계열 모델을 지원하며 향후 확장 예정입니다.
저는 기계론적 해석 가능성 (mechanistic interpretability) 분야에 입문한 지 얼마 되지 않았으므로, 제가 용어를 잘못 사용하는 점은 양해 부탁드립니다. 저는 이 분야에 깊이 몰입하게 되었고, Codex로 구축해 온 실험적인 도구를 공유하고 싶었습니다. Ultra 환경에서 GPT 5.6 Sol을 사용하는 Codex는 제가 느끼기에 최첨단 결과물들을 아주 강력하게 뽑아내고 있습니다. 저는 코딩을 전혀 할 줄 모르기 때문에 더욱 그렇습니다. 많은 기계론적 해석 가능성 (mechanistic-interpretability) 워크플로우는 Python 스크립트, Jupyter 노트북, 모델 훅 (model hooks), 내보낸 텐서 (exported tensors), 그리고 별도의 시각화 도구 사이를 오가야 합니다. CORTEX // MODEL OBSERVATORY를 통해 저의 목표는 이러한 요소들을 빠른 시각적 피드백 루프를 갖춘 하나의 로컬 데스크톱 환경으로 가져오는 것입니다. CORTEX는 로컬 IPC를 통해 격리된 Python/PyTorch 백엔드에 연결된 WebView2 호스트를 사용하는 네이티브 Windows 애플리케이션입니다. 모델 추론 (Model inference) 및 텐서 연산 (tensor operations)은 UI 프로세스 외부에서 실행되며, 애플리케이션은 로컬 Hugging Face 모델과 함께 완전히 오프라인으로 작동하도록 설계되었습니다.
현재 기능:
토큰 확률 현미경 (Token Probability Microscope): 선택된 토큰 확률, 순위가 매겨진 대안, 로그 확률 (log probabilities), 엔트로피 (entropy), 그리고 동기화된 토큰 검사를 포함하여 토큰 단위의 생성 텔레메트리 (telemetry)를 표시합니다.
로짓 렌즈 (Logit Lens): 선택된 레이어에서의 중간 어휘 예측을 포착하여 후보 출력들이 네트워크를 통해 어떻게 진화하는지 보여줍니다.
표현 공간 (Representation Space): 측정된 잔차 스트림 (residual-stream) 벡터를 포착하고 PCA를 통해 투영하여 대화형 은닉 상태 (hidden-state) 궤적 및 미니맵 시각화를 제공합니다. 선택 사항인 3D 투영 및 궤도 제어 기능은 현재 개발 중입니다.
어텐션 탐색기 (Attention Explorer): 선택된 헤드 레벨 어텐션 텐서 (head-level attention tensors)를 포착하고 측정된 어텐션 행렬 (attention matrices)을 표시합니다. 토큰 간 아크 뷰 (token-to-token arc view)와 확장된 쿼리 범위 (query-range) 제어 기능이 현재 추가되고 있습니다.
개입 실험실 (Intervention Lab): 활성화 패칭 (activation patching), 어텐션 헤드 절제 (attention-head ablation), 그리고 베이스라인과 수정된 실행 간의 비교를 포함한 인과적 실험 (causal experiments)을 지원합니다.
현재 지원되는 모델
Deep Cortex 계측 (instrumentation) 경로는 현재 다음 모델들을 지원합니다:
- GPT-2 계열 Hugging Face 모델
- Llama 계열 LlamaForCausalLM 모델
Llama 어댑터는 현재 테스트 단계에 있으며, 특히 생성 종료 시점의 잔차 캡처 (residual captures) 및 시각화 바인딩 (visualization binding) 관련 부분을 중점적으로 테스트하고 있습니다. Qwen 및 Mistral과 같은 추가적인 모델 제품군(model families)은 향후 지원 대상이 될 수 있으나, 현재 deep instrumentation 경로에서는 지원되지 않습니다. 별도의 표준 런타임 (Standard Runtime)을 통해 LM Studio와 같은 OpenAI 호환 로컬 엔드포인트에 연결할 수 있지만, 엔드포인트로 서비스되는 모델들은 동일한 내부 활성화 훅 (internal activation hooks)을 노출하지 않습니다.
실험적 연구 방향
저는 또한 Jacobian 기반의 개념 분석 (concept analysis)을 위한 매우 실험적인 포인트 앤 클릭 (point-and-click) 인터페이스를 탐구하고 있으며, 현재 이를 J-Space / Jacobian Lens라고 부르고 있습니다. 이는 개념적인 작업으로, 아직 CORTEX에서 과학적으로 검증되지 않았으며, 작동하는 연구 결과로 간주되어서는 안 됩니다.
하드웨어
현재 개발 및 테스트는 12 GB VRAM을 탑재한 RTX 4070 Ti에서 수행되고 있습니다. 의도하는 목표 대상은 FP16/BF16을 실용적으로 사용하는 약 0.5B–3B 범위의 소규모 로컬 모델입니다. 공식적인 성능 벤치마크 (performance benchmarks)는 아직 완료되지 않았습니다.
이 프로젝트는 초기 단계의 AI 보조 프로젝트이며, 저 또한 이 분야를 배우고 있는 중입니다. 건설적인 비판은 언제나 환영합니다.
/u/JayB_Official에 의해 r/OpenAI에 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기