9개의 인기 AI 에이전트 저장소를 스캔하며 알게 된 '증거 기반 레지스트리'의 교훈
요약
본 글은 AI 에이전트 디렉토리가 '홍보'에 치중하는 문제를 지적하며, 대신 코드가 실제로 무엇을 하는지 증거 기반으로 검증하는 중요성을 강조합니다. 필자는 공개 보고서 레지스트리 [Metal Mantra]를 구축하여 GitHub 저장소의 소스 코드를 분석하고 보안 및 프라이버시 등 다각적인 관점에서 객관적인 보고서를 제공합니다.
핵심 포인트
- 에이전트 평가는 '누가 잘 홍보했는가'보다 '코드가 무엇을 하는지'가 중요하다.
- Metal Mantra는 공개 소스 코드를 분석하여 5가지 가중치 기둥의 보고서를 생성한다.
- 증거 기반 시스템에서는 샘플링 전략 자체가 중요한 주장(claim)이 된다.
- 비공개 코드의 경우, GitHub Actions와 OIDC 토큰을 이용해 검증된 보고서('CI-attested')를 제공한다.
대부분의 AI 에이전트 디렉토리는 한 가지 질문에 답합니다. 누가 가장 잘 홍보했는가? 만약 어떤 에이전트가 당신을 대신해 행동할 것이라면(예: 예약하기, 파일 읽기, 도구 호출), 그것은 잘못된 질문입니다. 올바른 질문은 다음과 같습니다. 코드가 실제로 무엇을 하는지, 그리고 우리가 무엇을 모르는지?
이것이 제가 AI 에이전트에 대한 공개 보고서 레지스트리인 Metal Mantra를 구축한 이유입니다.
보고서란 무엇인가
공개 GitHub 저장소와 공식 도메인을 붙여넣으면, 결정론적 규칙들이 소스를 읽어 다섯 가지 가중치 기둥에 걸친 공개 보고서를 생성합니다:
| Pillar | Weight |
|---|---|
| Security & privacy | 25% |
| ... |
모든 추론은 규칙과 파일로 연결됩니다. 스캐너에는 AI가 없으므로, 동일한 저장소는 항상 동일한 결과를 제공합니다. (AI는 정확히 한 곳에만 나타납니다: 구매자의 설명에 따라 에이전트를 순위 매기는 선택적 상자입니다. 점수 자체를 건드리지 않습니다.)
제가 절대 어기지 않을 규칙
등급은 공개 소스에 대한 자동화된 신호일 뿐입니다. 보안 인증서가 아니며, 모든 보고서에는
첫 번째 스캔에서는 아카이브 순서로 선별된 80개의 파일을 읽었습니다. agents SDK와 같은 모노레포(monorepo)의 경우, 이 80개 파일은 예시와 문서였습니다. 스캐너는 사실상 데모를 통해 프레임워크를 평가하고 있었고, 존재하는 최고의 에이전트 SDK 중 하나에서 '이것이 에이전트인가?'라는 검증에 실패했습니다.
해결책은 지루했지만 중요했습니다. 파일을 제한하기 전에 순위를 매기는 것(제품 소스 우선, 그다음 미분류 파일, 예시, 문서 및 도구)과 일반적인 SDK 임포트를 인식하도록 에이전트 감지 규칙을 넓히는 것이었습니다. 이 교훈은 일반화됩니다: 증거 기반 시스템에서는 샘플링 전략 자체가 주장의 일부입니다. 무엇을 읽었는지 말할 수 없다면, 무엇을 발견했는지도 말할 수 없습니다.
비공개 코드
상업용 에이전트들은 소스 코드를 거의 공개하지 않습니다. 이런 경우, 소유자들은 자체 GitHub Actions 작업 내부에서 저희 스캐너를 실행합니다. 이 스캐너는 오직 규칙 ID와 개수만을 보내며, GitHub의 OIDC 토큰으로 인증됩니다. 서버는 각 발견 사항을 자체 규칙 카탈로그로부터 재구축하므로, 호출자는 발견 사항을 생략할 수는 있지만 꾸밀 수는 없습니다. 보고서는 'CI-attested'로 라벨링되며, 우리가 직접 실행한 스캔보다 눈에 띄게 약합니다.
사용해 보기
모든 공개 레포지토리의 첫 번째 스캔은 무료입니다: metalmantra.io/scan. 에이전트를 유지 관리하신다면, 어떤 규칙들이 잘못되었다고 느끼는지 알려주세요. 이 방법론은 공개되어 있으며, 지금까지 최고의 버그 보고서는 추론에 동의하지 않았던 사람들에게서 나왔습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기