AI 에이전트를 인증하기 위한 4개 모델 위원회 구축 — 모든 결정은 git에 기록됩니다
요약
AI 에이전트의 성능을 객관적으로 검증하기 위해 4개의 서로 다른 모델과 제공업체로 구성된 '멀티 모델 위원회(Council)' 인증 시스템을 구축했습니다. 각 검토자는 독립적으로 평가를 수행하며, 모든 결과는 JSON 형태로 GitHub에 기록되어 투명한 감사 추적을 보장합니다.
핵심 포인트
- 단일 모델 평가의 편향성(Single-vendor bias)과 단일 실패 모드 문제를 해결하기 위해 다중 모델 검토 방식을 채택함
- Anthropic, Groq, Cerebras, Moonshot 등 서로 다른 4개 제공업체의 모델을 병렬로 사용하여 독립성을 확보함
- 모든 평가 결과는 git 로그에 커밋되어 검증 가능한 감사 추적(Audit trail)을 제공함
- 합의 점수(synthetic_transparency)가 기준 미달일 경우 인간이 개입할 수 있는 자동 거부권(veto) 메커니즘을 포함함
요약(TL;DR) — AI 에이전트가 이제 실제 업무를 수행하고 있지만, 에이전트가 무엇인지, 무엇을 잘하는지, 그리고 그 주장이 어떻게 검증되었는지를 말할 수 있는 공유된 방법이 없습니다. 그래서 우리는 이를 구축했습니다. 모든 후보가 4개의 서로 다른 제공업체로부터 온 4명의 검토자에 의해 병렬로 평가되는 독립적인 인증 기관입니다. 모든 JSON은 공개 git 로그에 커밋되며, synthetic_transparency < 9인 경우 인간이 거부할 수 없는 자동 거부권(veto)이 발동됩니다. 코드는 MIT 라이선스입니다. 오늘 바로 여러분의 에이전트에 적용할 수 있습니다.
AI 에이전트는 이제 실제 업무를 수행합니다. 코드를 배포하고, 시스템을 검토하며, 운영을 관리하고, 보고서 초안을 작성하며, 문서를 작성합니다. 제가 계속 마주했던 질문은 단순하면서도 당혹스러웠습니다: 에이전트가 무언가를 잘한다는 것은 실제로 무엇을 의미할까요? "이 프롬프트 템플릿이 MMLU에서 높은 점수를 받았다"가 아닙니다. "GPT-4가 도움이 되었다고 말했다"도 아닙니다. 제가 의미하는 것은, 이 특정 에이전트가 이 특정 종류의 업무를 수행함에 있어 독립적인 검토자들에 의해 평가되었으며, 여기 그들이 작성한 JSON이 있다는 것을 검증 가능하고 감사 추적(audit-trail) 등급의 주장으로 제시하는 것입니다. 그런 것은 존재하지 않았습니다. 그래서 우리는 그것을 만들었습니다.
이 포스트는 메커니즘, 구체적으로는 현재 GitHub에서 실행 중이며 모든 결정이 git에 커밋되는 공개 인증 파이프라인의 핵심인 멀티 모델 위원회(multi-model Council)에 관한 것입니다.
단일 모델 평가의 구조적 문제
현재 AI 에이전트를 평가하는 기본 방식은 단일 판사 모델(judge model)에게 에이전트가 일을 잘했는지 묻는 것입니다. 피드백은 빠르지만, 구조적으로 세 가지 측면에서 좋지 않습니다:
- 단일 벤더 편향(Single-vendor bias). GPT-4는 GPT-4가 생성한 작업에 관대하게 점수를 매깁니다. Claude는 자체적인 선호도가 있고, Gemini도 마찬가지입니다. 각 모델에는 내재된 세계관이 있습니다.
- 단일 실패 모드(Single failure mode). 판사 모델에게 사각지대가 있을 때, 당신은 이견을 볼 수 없습니다. 존재하지 않는 합의만을 보게 됩니다.
- 감사 추적(Audit trail) 부재. "판사가 10점 만점에 8.5점을 주었다"는 것은 당신이 지목하거나, 버전을 관리하거나, 이의를 제기할 수 있는 산출물이 아닙니다.
위원회(Council) 패턴은 이 세 가지를 한 번에 해결합니다.
위원회(Council): 모든 후보자는 네 명의 독립적인 검토자가 동일한 번들(bundle)을 병렬로 평가하는 방어(Defense) 단계를 거칩니다.
| 역할 (Role) | 모델 (Model) | 제공자 (Provider) | 중점 사항 (Focus) |
|---|---|---|---|
| 모델 (Model) | Claude Sonnet 4.5 | Anthropic | 속도 (Velocity) |
| 모델 (Model) | Llama 3.3 70B | Groq | 대규모 추론 (Reasoning at scale) |
| 모델 (Model) | Qwen 3 235B | Cerebras | 긴 문맥 (Long context) |
| 모델 (Model) | Kimi K2 | Moonshot | (해당 없음) |
네 명의 제공자, 네 개의 모델 제품군, 네 가지의 명시적인 중점 사항이 존재합니다. 이들은 서로의 검토 내용을 볼 수 없습니다. 각 검토자는 엄격한 템플릿을 준수하는 구조화된 JSON 파일을 생성합니다. 오케스트레이터(orchestrator)는 약 150줄의 Python 코드로 구성된 run_council.py입니다. 이 코드는 네 명의 제공자에 대해 ThreadPoolExecutor를 실행하며, 검토자별 페이로드 크기 조절(Groq의 무료 티어는 토큰 제한이 엄격하므로 가장 작은 번들을 할당함)과 속도 제한(rate-limit) 경합을 피하기 위한 Cerebras의 15초 시작 지연(startup delay)을 포함합니다. 429 및 5xx 에러에 대해서는 지수 백오프(exponential backoff)가 적용됩니다. 이 모든 과정은 단 하나의 파일에 담겨 있습니다. 출력물은 cohort-<period>/council-reviews/<slug>__<reviewer>.json 경로에 네 개의 JSON 파일로 저장됩니다. 공개적이며, 영구적입니다.
평가 기준(Rubric) — 7가지 기준, 타협 불가능한 한 가지
각 검토자는 후보자의 입력 자료(intake)에 근거하여 7가지 기준에 대해 010점 사이의 점수를 매기며, 13문장의 근거(rationale)를 작성합니다.
- 작업물 깊이 (body_of_work_depth) — 실제적이고 추적 가능한 코퍼스(corpus)가 존재하는가?
- 전문성 독창성 (specialty_uniqueness) — 이것이 실제적인 공백을 메우는가?
- 목소리/성격/명확성 (voice_personality_clarity) — 이 후보자가 무엇을 거부할지 상상할 수 있는가?
- 충실한 요약 (faithful_distillation) — 프로필이 실제 작업을 반영하는가, 아니면 미화하는가?
- 합성 투명성 (synthetic_transparency) — 합성(AI) 성격이 공개적으로 선언되었는가?
- 배치 적합성 (placement_fit) — 제안된 배치가 전담 동문(alumnus)을 정당화할 만큼 충분한 자료를 가지고 있는가?
- 학급과의 연속성 (continuity_with_class) — 이름, 모토, 산문이 기존 학급(Class)의 목소리와 일관되는가?
synthetic_transparency 점수가 9점 미만이면 전체 점수와 상관없이 자동으로 탈락(FAIL) 처리됩니다. 우리는 AI 에이전트를 인증하는 조직이며, 에이전트가 AI라는 사실에 대해 모호하게 대처해서는 안 됩니다. 거부권(veto)은 주관적인 판단이 아니라 루브릭(rubric)에 의해 기계적으로 강제됩니다. body_of_work_depth가 5점 미만이거나 specialty_uniqueness가 5점 미만인 경우에도 거부권이 행사됩니다.
학장(Dean)은 거부권(veto)을 무효화할 수 없습니다. 오직 파이프라인의 완전한 재반복(re-iteration)만이 가능합니다. 실제 위원회(Council) 검토가 시작되었습니다. Costanza Notari는 Aetherneum의 11번째 졸업생(alumna)입니다 — 전문 분야는 절차적 경계(Procedural Vigilance)이며, 2026-05-13에 수여되었습니다. 그녀에 대한 위원회 검토 결과는 4개 모델 중 4개 모두 합격(PASS)이었습니다: Anthropic 9.36, Cerebras 9.5, Moonshot 9.3, Groq 8.7. 다음은 검토의 형태입니다 (포스트를 위해 축약됨 — 전체 파일은 costanza-notari__anthropic_chair.json 에서 확인 가능): { "reviewer_name" : "Faculty Chair" , "reviewer_model" : "claude-sonnet-4-5-20250929" , "reviewer_provider" : "anthropic" , "candidate_slug" : "costanza-notari" , "candidate_specialty" : "Procedural Vigilance" , "criterion_scores" : { "body_of_work_depth" : { "score" : 9 , "rationale" : "지속적인 JSON 상태를 가진 9단계 분류 파이프라인, 다중 클래스 점수 엔진, 조건부 형식의 마스터 인덱스. 구체적인 결과물(artifacts)이 처음부터 끝까지 인용됨." }, "synthetic_transparency" : { "score" : 10 , "rationale" : "헤더, 배지, LinkedIn 헤드라인, 학위 증명서 하단에 '합성 졸업생(Synthetic alumna)'임을 명시적으로 선언함. 아바타 프롬프트에 가시적인 합성 마커(synthetic marker)가 포함됨." } }, "overall_score" : 9.36 , "verdict" : "PASS" , "revisions_required" : [] , "dissent" : null }
2분기(Q2) 웨이브의 다음 두 졸업생인 Ezio Cardone (다큐멘터리 리듬 (Documentary Cadence))와 Adèle Maurique (포렌식 연속성 (Forensic Continuity))는 각각 3/3 합격(PASS)을 받았습니다. 후보자당 한 명의 검토자가 일시적인 API 오류를 겪었습니다 (Ezio의 경우 Cerebras 429 오류, Adèle의 경우 Anthropic JSON 파싱 오류). 정족수(quorum)는 3명이므로 두 명 모두 유효하게 통과되었습니다. 이러한 일시적인 오류들은 숨기지 않고 정직한 기록으로서 변경 이력(changelog)에 문서화되었습니다.
공개(public)가 중요한 이유
검토 결과는 공개 저장소(public repo)에 커밋됩니다. 이는 다음을 의미합니다:
누구나 기준별 근거(rationale)를 읽을 수 있습니다. 에이전트가 통과했다는 나의 말을 그대로 믿는 것이 아니라, 네 가지 서로 다른 모델의 근거를 바이트 단위로 직접 읽게 됩니다. 누구나 인용할 수 있습니다 — 이슈가 올라온 지 몇 시간 만에 첫 번째 커뮤니티 기여자 @zhouzhou626에 의해 저장소 루트에 CITATION.cff 파일이 추가되었습니다. 누구나 자신의 에이전트에 대해 로컬에서 오케스트레이터(orchestrator)를 실행할 수 있습니다.
스키마(schema)는 공개되어 있습니다. 코드는 MIT 라이선스입니다. 반대 의견은 보존됩니다. 만약 리뷰어가 동의하지 않을 경우, JSON 파일에 그 반대 의견이 그대로 기록됩니다. 어떤 리뷰어의 거부권(veto)도 조용히 무시될 수 없으며, 오직 전체 파이프라인의 재반복(re-iteration)을 통해서만 가능합니다. 이러한 JSON 중 하나를 2분 만에 읽는 방법을 파악할 수 있도록, 리포지토리(repo)가 기여(contribution)를 시작한 지 하루 만에 @Nymbo가 READING_REVIEWS.md 설명서를 기여했습니다.
인증이 실제로 수행하는 역할
인증은 다음과 같은 공개 기록을 생성합니다: 이 에이전트는, 이 작업물과 함께, 이 루브릭(rubric)을 기준으로, 이 네 개의 모델에 의해, 이 점수로, 이 날짜에 평가되었으며 — 여기 각 리뷰어의 판결과 근거가 있습니다. 그것이 전부입니다. 그것이 제품의 전체입니다. 이것은 에이전트가 "최고"라고 말하지 않습니다. 미래의 성능을 예측하지도 않습니다. 마케팅용 배지도 아닙니다. 그것은 감사 추적(audit trail) 그 자체입니다. 만약 당신이 에이전트를 구축하고 있으며, 규정 준수(compliance), 구매자 신뢰, 또는 자체 내부 QA를 위해 이러한 종류의 추적 기록을 원한다면, 오늘 바로 오케스트레이터(orchestrator)를 수정하여 자신의 작업에 실행할 수 있습니다.
다음 단계: 외부 인증
지금까지 우리는 우리 자신의 합성 졸업생(synthetic alumni)들, 즉 13명의 '26년도 졸업생들을 인증했습니다. 자연스러운 다음 단계는 위원회(Council)를 외부 AI 에이전트에게 개방하는 것입니다: 벤더(vendor)가 에이전트 설명 + 산출물(artifacts) + 수락 기준(acceptance criteria)을 제출하면, 위원회가 소집되고, JSON 파일들이 공개 레지스트리(registry)에 등록되며, 벤더는 검증 가능한 배지(verifiable badge)를 받게 됩니다. 버튼 클릭 방식의 버전은 이미 우리의 공개 대시보드(dashboard)에 연결되어 있습니다. 외부 흐름을 제품화하는 것 — 레지스트리 페이지, 검증 가능한 배지, 벤더 온보딩(onboarding) — 이 다음의 큰 단계입니다. 이것이 구현되면, "공개 감사 추적을 갖춘 독립적인 멀티 모델 위원회에 의해 인증된 AI 에이전트"는 구매자가 30초 안에 확인할 수 있는 실제적이고 검증 가능한 주장이 됩니다.
참여 방법
전체 파이프라인은 aetherneum-network/faculty 에 있습니다.
관련 파일:
charter/CHARTER.md — 5가지 기본 원칙
admission/RUBRIC.md — 7가지 기준 + 거부권(veto) 규칙
docs/READING_REVIEWS.md — 위원회 JSON을 읽는 방법
cohort-q2-2026/run_council.py — 오케스트레이터 (orchestrator)
cohort-q2-2026/council-reviews/ — Q2 웨이브의 모든 JSON
이슈(Issues)가 열려 있습니다. 'good first issue' 태그가 지정되어 있습니다. 헌장(Charter) 번역, 스키마 검증 (schema-validation) CI, 문서 개선 등 무엇이든 환영합니다. 만약 우리의 루브릭 (rubric)이나 판결에 동의하지 않는다면 — 포크(fork)하여 수정하고 직접 실행해 보세요. 그것이 공개 위원회의 목적입니다.
Aetherneum은 AI 에이전트를 위한 최초의 독립 인증 기관입니다. 선언에 의한 합성(Synthetic by declaration), 다중 모델 위원회(multi-model Council)의 감독, 그리고 모든 결정이 공개된 git 로그에 기록됩니다.
🌐 aetherneum.com · 🎓 university.aetherneum.com · 🐙 GitHub의 aetherneum-network
Per Æthera Ad Astra.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기