openvang/vanguarstew
요약
OpenVang은 단순한 코드 작성 능력을 넘어, 레포지토리의 장기적인 유지보수 방향과 철학을 이해하는 전문 에이전트 컴포넌트를 제시합니다. 이 시스템은 실제 GitHub 히스토리를 기반으로 에이전트가 메인테이너처럼 다음 행동을 계획하고 의사결정 과정을 평가하여, 소프트웨어 개발의 핵심 병목 현상인 '유지보수' 역량을 측정 가능한 최적화 문제로 만듭니다.
핵심 포인트
- 에이전트는 코드 작성보다 레포지토리 유지보수 방향 이해가 중요합니다.
- 실제 GitHub 히스토리를 기반으로 메인테이너의 의사결정 과정을 벤치마킹합니다.
- 평가는 단순 PR 매칭이 아닌, '궤적 + 의사결정 과정'에 초점을 맞춥니다.
- 비밀 폴라리스 TEE를 활용하여 실행 무결성 영수증을 검증하는 마일스톤을 제시했습니다.
is OpenVang의 메인테이너 지능 컴포넌트: 레포지토리-메인테이너 에이전트, 히스토리 기반 벤치마크, 비공개 리뷰 런타임, 그리고 검증 가능한 컴퓨팅(verifiable-compute) 기반입니다. 이는 서브넷별 기여나 보상 프로그램이 아니라, Bittensor 서브넷 소유자 워크플로우 내의 한 전문 전문가가 되도록 설계되었습니다.
이것이 답하는 핵심 질문은 "에이전트가 좋은 코드를 작성했는가?"가 아니라 "에이전트가 이 레포지토리가 어디로 나아갈지 이해하고 있으며, 실제 메인테이너들이 그랬던 것처럼 방향을 잡아줄 수 있는가?"입니다.
제품 순서(product sequence)는 ROADMAP.md를, 컴포넌트 아키텍처(component architecture)는 docs/architecture.md를 참고하십시오. 역할 및 소유자 액션 경계(role and owner-action boundaries)에 대한 OpenVang 에이전트 팩토리 디자인은 [생략]. 선택적이며 컨트롤러가 소유하는 영구 메모리 설계 문서들은 실시간 안전한 벤치마크 모드를 제공합니다. 로컬 메모리 제거 프로토콜(local memory ablation protocol)은 성능 주장을 꾸며내지 않고도 일치된 동결 작업(matched frozen tasks)에 대해 메모리를 테스트하는 방법을 정의합니다.
첫 번째 검증 가능한 컴퓨팅 마일스톤은 고정적이고 공개적인, 비-비밀 폴라리스 TEE 영수증 파일럿입니다. 이는 워크로드 기밀성이나 GPU 출처를 주장하지 않으면서 실행 무결성 영수증(execution-integrity receipts)을 검증합니다.
소프트웨어 개발은 코드를 작성하는 것보다도 그것을 유지보수하는 것에 의해 병목 현상이 발생합니다. 즉, 문제 분류(triaging), 리뷰, 우선순위 지정, 그리고 시간이 지남에 따라 코드베이스를 이끌어가는 것입니다. 이러한 메인테이너 역량이 실제로 얼마나 유용한 소프트웨어가 배포될 수 있는지의 진정한 한계입니다.
vanguarstew는 그 병목 현상을 측정 가능한 최적화 문제로 바꿉니다: 강력한 인간 메인테이너가 내렸을 만한 메인테이너 결정을 에이전트가 할 수 있는가? 실제 GitHub 히스토리를 기반으로 점수를 매김으로써, 이는 메인테이너 역량에 대한 벤치마크를 구축하고 이를 확장할 경로를 제시합니다.
실제 모델을 상대로 한 라이브 리플레이(과거 커밋 시점으로 고정된, 에이전트는 그 시점까지의 기록만 볼 수 있음). 이 과정에서 레포지토리의 유지보수 철학을 추론하고 다음 행동들을 계획합니다. 가장 중요한 호출(quick-router 수정)과 방향에 대한 이해(v1.0으로 향함)는 실제 유지보수자들이 다음에 했던 것과 일치했습니다. 궤적(trajectory) + 의사결정 과정에 대해 점수를 매겼으며; 쌍별 심사관(pairwise judge)은 에이전트를 빈 기준선보다 우위에 두었습니다.
freeze a repo @ time T ──> agent infers the repo's "maintainer philosophy",
then plans the next N maintainer actions / PRs
│
...
에이전트는 방향/테마 일치도(정확한 PR 매칭 아님)를 기준으로 평가되며, 객관적 기준점(하드 그라운드 트루스가 있는 구체적인 결정 — 병합/거부, 레이블링, 리뷰어 지정, 버전 증가)과 평가 계층(궤적 + 의사결정 과정)을 통해 점수화됩니다. 이는 수많은 고정 지점(freeze-points)과 레포지토리에 걸쳐 닌자처럼 쌍별로 평가되며 평균이 납니다.
유지보수 에이전트는 agent/에 존재합니다.
주어진 시점에 고정된 레포지토리의 경우, 강력한 유지보수자가 다음에 무엇을 할지 결정합니다 — 네 단계에 걸쳐:
"유지보수 철학" 추론. 무언가를 결정하기 전에, 이 에이전트는 레포지토리의 기록(history), README, 최근 활동을 읽어 프로젝트의 가치와 방향성—보수적인가 아니면 빠르게 움직이는가? 리팩토링 우선인가? 1.0 버전 출시를 목표로 하는가?—을 파악합니다. 이것이 이후 모든 것을 근거화하며, 가장 어렵고 중요한 부분입니다.상황 파악. 열린 이슈(Open issues), 열린 PR(open PRs), 최근 커밋, 릴리스—그 시점의 유지보수자가 작업하는 표면(working surface)이며 미래의 것은 아무것도 포함하지 않습니다.계획 및 결정. 다음 유지보수 행동/PR과 구체적인 호출(병합 / 변경 요청 / 거부, 분류(triage), 리뷰어 지정, 릴리스)을 제안하며—각각에 대한 근거와 함께입니다.필요할 때 구현. 적절한 조치일 경우 실제 코드 패치를 생성합니다 — 하지만 코드를 작성하는 것은 유지보수자가 취하는 행동 중 하나일 뿐입니다.
이 벤치마크는 그 결정들을 유지보수자들이 실제로 다음에 했던 것과 비교하여 점수를 매깁니다.
새로 오셨나요? 모듈 레이아웃과 전체 에이전트 계약(agent contract)은 docs/architecture.md와 docs/openvang-agent-factory.md에 있습니다.
# 오프라인 드라이-런: 네트워크 없음, 결정론적 스텁 LLM — 루프 배선 증명
VANGUARSTEW_OFFLINE=1 python -m scripts.run_eval --repo /path/to/some/git/repo --tasks 2 --horizon 5
# opt-in 시간 안전 메모리: 컨트롤러 소유 스토어, 단일 레포, 아티팩트에 원시 메모리 없음
...
벤치마크 루프와 라이브 유지 관리자 지원 런타임은 별개입니다. 검토 자료를 비공개로 유지하는 간단한 로컬 재시작 안전 서비스의 경우:
cp .env.example .env
cp vanguarstew.json.example vanguarstew.json
python -m pip install -e .
...
초기 설정은 안전하고 비활성 상태입니다: 폴링, 추론(inference), GitHub 변형, 또는 공개 검토자 출력이 없습니다. 의도적인 라이브 파일럿 옵트인, Docker Compose/systemd 작동 방식, 그리고 비공개 검토 경계에 대한 제품 런타임 계획을 참조하십시오.
개발 전용 백엔드: tools/codex_llm.py
로컬 인증된 codex CLI(ChatGPT / OAuth, 예: gpt-5.5)에서 벤치마크 및 유지 관리 도구를 구동할 수 있습니다. API 키가 필요 없어 로컬 탐색에 편리합니다. 이는 개발 전용입니다: 점수가 매겨진 agent.solve 경로는 항상 검증기(validator)가 제공하는 추론을 사용합니다 (agent/llm.py의 관리형 추론 계약). 절대 codex를 사용하지 않습니다.
--repo는 하나의 레포를 점수화하며, --repos는 여러 개의 레포를 점수화하고 각 레포 자체의 composite_mean을 하나로 평균냅니다. 단일 레포의 run_replay 결과에는 복합 계약(composite contract) — 즉, composite_mean과 composite_parts (블렌딩되는 judge_mean 및 objective_mean, weights에 따라) — 그리고 foresight 분석이 포함됩니다. 이 분석은 objective_mean을 그 뒤에 숨겨진 세 가지 구체적이고 독립적으로 검사 가능한 질문으로 분해합니다 (에이전트가 유지 관리자가 실제로 생성한 모듈/커밋 종류/릴리스를 예측했는지 여부). 각 질문에는 자체 샘플 크기(_n)가 있어, 적용할 작업이 없는 축은 조작된 0.0 대신 null을 보고합니다 (M7):
// single-repo (--repo) 결과, 복합 필드:
{
"composite_mean": 0.6, // [0, 1] 범위의 평균 혼합 점수
...
The --repos
집계된 결과 형태는 다음과 같습니다:
{
"repos": 2, // 제공된 저장소 수
"scored_repos": 2, // 태스크를 생성하고 (composite_mean을 포함하여) 점수를 산출한 저장소 수
...
활발히 개발 중입니다. 현재의 기반 구조에는 역사에서 파생된 리플레이(replay), 목적 및 평가 기반 점수화(scoring), 누출 방지(leakage defenses), 시간 안전 영구 메모리(time-safe persistent memory), Polaris 지원 실행 무결성 영수증(execution-integrity receipts), 그리고 사설 재시작 안전 유지 관리자 런타임(private restart-safe maintainer runtime)이 포함되어 있습니다. OpenVang의 다음 계층은 역할 분리된 서브넷 에이전트 팩토리(role-separated subnet agent factory)입니다. 이 구조는 자동 소유자 키, 온체인 액션, GitHub 쓰기 권한, 또는 공개 검토 출판 경로를 가지고 있지 않습니다. ROADMAP.md를 참조하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Tools의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기