AI 에이전트가 스스로를 측정하게 만든 방법: 아웃컴 레저(outcome ledger)
요약
본 글은 AI 에이전트의 신뢰성을 높이기 위해 '아웃컴 레저(outcome ledger)'라는 개념을 제안합니다. 이 레저는 에이전트가 수행한 모든 작업에 대해 성공 여부와 실패 이유를 추가 불가능하게 기록하여, 단순 시연 이상의 객관적인 측정 지표를 제공합니다. 이를 통해 에이전트는 스스로의 성능을 검증하고 개선할 수 있습니다.
핵심 포인트
- 에이전트의 신뢰성은 '성공 주장'이 아닌 '검증 가능한 비율'로 측정되어야 합니다.
- 아웃컴 레저는 모든 작업의 판결(passed)과 이유(why)를 기록하는 추가 불가능한 원본 데이터베이스입니다.
- 자가 검증을 위해 복잡한 도구보다, 단순하고 결정론적인 로그 구조가 가장 중요합니다.
- CPU 노트북 환경에서도 에이전트 구축이 가능하며, 인지(cognition)와 배관(plumbing) 분리가 핵심입니다.
대부분의 '내 에이전트는 자율적이다'라는 글들은 성공적인 시연(happy-path demo)만을 보여줍니다. 데모는 에이전트가 작업을 _완료할 수 있다_는 것만 알려줄 뿐입니다. 그것은 에이전트가 얼마나 빠른 속도로 완료하는지, 또는 실패 횟수—즉, 신뢰하기 위해 실제로 필요한 숫자—에 대해서는 거의 아무것도 말해주지 않습니다. 그래서 저는 CPU 전용 노트북에서 24시간 작동하며 자체 검증(self-verifying)을 수행하는 에이전트를 구축하려고 했을 때, 가장 먼저 만든 것은 플래너가 아니었습니다. 바로 **레저(ledger)**였습니다.
Repo: https://github.com/openamer/openamer
아이디어: 모든 작업이 검증 가능한 한 줄을 기록한다
에이전트는 성공을 주장할 수 없습니다. 에이전트가 실행하는 모든 작업은 자체 평가와 판결(verdict)과 함께 아웃컴 레저에 단일하고 추가 불가능한(append-only) 라인을 추가합니다:
{"ts":"2026-10-09T21:59:34Z","task":"...","goal":"...","agent":"...","passed":false,"why":"exit=1 Traceback ... AssertionError"}
passed 필드가 판결이며, why가 추론(reasoning)입니다. 이 파일은 추가 불가능하며—실패는 성공과 같은 장소에 기록되므로, 누락을 통해 숨길 수 없습니다. 이 하나의 설계 결정에서 세 가지 결과가 도출됩니다:
- 측정 지표는 느낌이 아닌 비율이다.
왜 자가 검증 스웜(swarm)에게 이것이 먼저 필요한가
스스로를 측정할 수 없는 스웜은 데모에 최적화되고 어둠 속에서 표류하게 됩니다. 이 레저(ledger)는 전체 루프가 의존하는 진실의 근거입니다. 자가 개선 패스는 이를 읽어 반복되는 실패 패턴을 찾고, 통과율 추세가 건강 신호이며, 에이전트가 자신에 대해 하는 모든 주장은 파일 속 숫자를 통해 조정되어야 합니다. 이것은 '자가 검증(self-verifying)'을 위한 가장 저렴한 기반입니다. 즉, 추가 전용 로그(append-only log), 부울 값(boolean), 그리고 이유 문자열(reason string)만 있으면 됩니다.
또한 이는 다른 방향으로도 정직성을 강제합니다. 이 글을 쓰면서 제가 지킨 규칙은 '방금 측정하지 않은 카운트를 절대 언급하지 않는다'였습니다. 위에 제시된 숫자들은 글을 쓰기 직전에 라이브 레저에 대해 두 줄의 집계(aggregate)를 실행한 결과입니다. 독자님이 읽으실 때 이미 오래되었다 하더라도 괜찮습니다 — 다시 실행하면 됩니다.
CPU 노트북에서 실행하기
제약 조건의 나머지 절반은 이것이 GPU가 없는 단일 노트북에서 실행된다는 것입니다. 이를 가능하게 하는 분할 방식은 인지(cognition)와 배관(plumbing)을 분리하는 것입니다. 작은 로컬 모델이 결정(decisions) — 다음에 무엇을 할지, 어떤 도구를 적용할지 — 를 처리합니다. 나머지 모든 것(도구 자체, 스케줄링, 그리고 이 글의 검증 과정)은 가속기가 필요 없는 일반적인 결정론적 코드입니다. 이때 병목 현상은 역량(capability)이 아니라 지연 시간(latency)이며, 짧은 프롬프트를 유지하고 결정론적 계층이 무게를 지니게 함으로써 이를 확보할 수 있습니다.
여기서 얻어갈 것
만약 신뢰하고 싶은 에이전트를 구축하고 있다면, 오늘날 추가할 수 있는 가장 작고 유용한 것은 또 다른 도구가 아닙니다. 그것은 레저입니다: 작업당 하나의 추가 전용 라인, 부울 판결(verdict), 그리고 이유가 필요합니다. 나머지 모든 것 — 추세, 회귀 감지, 자가 개선, 정직한 주장 — 은 이 레저를 기반으로 파생됩니다.
Repo: https://github.com/openamer/openamer
(본 게시물의 수치는 발행 시점의 memory/si/outcome_ledger.jsonl에서 측정된 실시간 데이터입니다. 벤치마크 순위나 '세계 최고'라는 주장은 없으며, 오직 레저(ledger)만 제시합니다.)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기