재시도 횟수가 새로운 작업으로 계산될 때 에이전트 지표가 거짓말할 수 있습니다.
요약
AgentMeasure는 AI 에이전트 원격 측정(telemetry)을 위한 개방형 측정 인프라입니다. 이 도구는 Codex 및 Claude Code 세션 로그를 분석하여 중복 기록, 재시도 체인 등을 식별하고 논리적 작업과 개별 시도를 분리합니다. 또한 증거의 상태를 PASS, FAIL, UNPROVABLE로 명확히 보고하는 기능을 제공합니다.
핵심 포인트
- 논리적 작업과 개별 시도를 구분하여 감사 가능한 지표 제공
- 재시도 체인 및 중복 기록을 식별하는 기능 탑재
- 증거가 불충분할 경우 'UNPROVABLE'로 명확히 표시
- Codex 및 Claude Code 세션 로그 분석 가능
AgentMeasure는 AI 에이전트 원격 측정(telemetry)을 위한 개방형 측정 인프라로, Codex 및 Claude Code 세션 로그를 확인할 수 있는 로컬 도구를 제공합니다.
이는 기존 로그에서 중복 기록, 재시도 체인, 연속적인 도구 실패 등을 검사하여 논리적 작업과 개별 시도를 분리하는 데 도움을 줍니다. 또한 증거가 누락된 경우 이를 '0'으로 처리하기보다 UNPROVABLE로 표시합니다.
주요 기능:
• 로컬 상태 점검(Local healthcheck) – 실행 시간 네트워크 호출 없이 기존 Codex 배포 로그 및 Claude Code 세션 로그를 읽습니다.
• 재시도 인식 검사(Retry-aware checks) – 터미널 요약 및 로컬 HTML 보고서에서 중복 기록, 재시도 체인, 연속적인 도구 실패를 식별합니다.
• 명시적 증거 상태(Explicit evidence status) – 사용 가능한 증거가 결론을 뒷받침할 수 없는 경우 PASS, FAIL 또는 UNPROVABLE로 보고합니다.
• 준수 패키지(Conformance pack) – GitHub Action을 포함하여 토큰 회계 및 원격 측정 가정을 테스트하기 위한 픽스처를 제공합니다.
• 작업 대 시도 모델(Operation-versus-attempt model) – 보다 감사 가능한 사용 지표를 위해 하나의 논리적 의도를 개별 실행 시도와 구별합니다.
이것은 오픈 소스이며 (MIT 라이선스).
답글의 링크 👇
AI 자동 생성 콘텐츠
본 콘텐츠는 X AI 사용법/팁의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기