
Anthropic이 Claude가 말하기 전에 생각하는 것을 읽는 도구를 오픈 소스화했습니다
요약
Anthropic이 모델의 내부 개념을 파악할 수 있는 오픈 소스 도구인 jacobian lens(j-lens)를 공개했습니다. 이 도구는 저렴한 비용으로 모델의 내부 방향(j-space)을 읽어내어 모델의 의도를 더 정확히 해석할 수 있게 돕습니다.
핵심 포인트
- j-lens는 레이어당 한 번의 행렬 곱셈으로 작동하여 매우 효율적임
- 희소 자동 인코더(SAE)의 높은 훈련 비용 문제를 해결하는 대안
- Qwen 등 HuggingFace의 오픈 웨이트 모델에서 즉시 사용 가능
- 모델의 내부 활동을 어휘 토큰으로 디코딩하여 해석 가능성 제공
Anthropic이 Claude가 어떤 말을 할지 하기 전에 그 생각이 무엇인지 읽는 데 사용하는 도구를 오픈 소스화했습니다 🤯
이것은 jacobian lens (j-lens)라고 불립니다. 이 도구는 모델이 단어 하나를 쓰기 전에 다루고 있는 정확한 개념들을 담고 있는 내부 방향들의 작은 집합인 j-space를 찾는 데 사용되었습니다.
작동 원리: 대부분의 해석 가능성(interpretability) 도구들은 사용자에게 선택을 요구합니다. 희소 자동 인코더(sparse autoencoders)는 정확하지만 훈련 비용이 많이 듭니다. 기존의 logit lens는 무료이지만 초기 레이어에서 노이즈로 변합니다. j-lens는 레이어당 한 번의 행렬 곱셈으로, 저렴하며 모든 곳에서 읽기 가능한 상태를 유지합니다.
$0으로 얻을 수 있는 것들:
→ 어떤 레이어의 활동이라도 순위가 매겨진 어휘 토큰(vocabulary tokens)으로 디코딩하는 렌즈
→ Qwen을 예시로 사용하여 모든 오픈 웨이트 HuggingFace 디코더에서 작동
→ 전체 워크스루 노트북, 모델 로드, 렌즈 로드 또는 피팅, 레이어 뷰 렌더링
→ Neuronpedia에서 실시간으로 설정 없이 시연 가능
대체하는 것들:
→ 연구하려는 모든 모델에 대해 자체 희소 자동 인코더를 훈련시키는 과정
→ 출력만 보고 모델이 '의도했던' 바를 추측하는 행위
설치 방법 (2분 소요):
- pip install -e .
- transformers를 사용하여 모델과 토크나이저 로드
- jlens.from_hf(hf, tok)로 래핑
- 사전 훈련된 렌즈를 적용하거나 약 100개의 프롬프트에 대해 자체적으로 피팅
솔직히 말하자면: Claude의 가중치나 코퍼스(corpora)는 포함되어 있지 않으며, 이는 Claude를 직접 읽는 것이 아니라 사용자의 GPU에서 오픈 모델을 읽는 것입니다.
899개의 스타, apache-2.0 라이선스, 무료 및 오픈 소스입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @socialwithaayan (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기