CircuitKIT: 기계론적 해석 가능성 (Mechanistic Interpretability)을 위한 회로 발견, 평가 및 적용 툴킷
요약
CircuitKIT는 기계론적 해석 가능성(Mechanistic Interpretability) 연구를 위해 회로 발견, 평가, 개입 과정을 통합한 오픈소스 라이브러리입니다. 파편화된 기존 워크플로우를 연결하여 알고리즘 비교와 다운스트림 애플리케이션 적용을 용이하게 합니다.
핵심 포인트
- 회로 발견, 평가, 개입을 하나의 워크플로우로 통합
- 타입 지정 및 직렬화 가능한 표현을 통한 데이터 관리
- 다양한 발견 알고리즘과 선언적 인터페이스 제공
- 모델 편집, 가지치기 등 다운스트림 개입 지원
회로 분석 (Circuit analysis)은 모델 설명뿐만 아니라 가지치기 (pruning), 편집 (editing), 스티어링 (steering), 선택적 미세 조정 (selective fine-tuning)과 같은 다운스트림 개입 (downstream interventions)을 지원할 수 있습니다. 그러나 현재 이러한 분석을 수행하려면 발견 (discovery), 평가 (evaluation), 개입 (intervention)을 위한 별도의 구현체들을 하나로 엮어야 하며, 많은 발견 방법론에서 요구되는 대조적 프롬프트 (contrastive prompts)를 직접 작성해야 합니다. 이러한 파편화는 방법론 간의 비교를 어렵게 만들고, 표준적인 작업 (canonical tasks) 이외의 적용을 제한합니다. 우리는 타입이 지정되고 직렬화 가능한 표현 (typed, serializable representation)을 통해 회로 분석 워크플로우를 연결하는 소스 공개 라이브러리인 CircuitKIT를 소개합니다. CircuitKIT는 일련의 발견 알고리즘 (discovery algorithms), 구조화된 데이터를 발견 작업으로 매핑하기 위한 선언적 인터페이스 (declarative interfaces), 상호 보완적인 회로 진단 (circuit diagnostics), 그리고 다운스트림 애플리케이션 모듈을 제공합니다. 이러한 구성 요소들은 회로 분석을 수행하고 비교하기 위한 공통 인프라를 제공합니다. 라이브러리, 예제, 노트북 및 문서는 https://github.com/Lexsi-Labs/CircuitKIT 에서 공개됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기