에이전트 기반 코딩 제품을 신뢰하기 전에 구축해야 할 5개 파일 규모의 카나리(Canary)
요약
에이전트 기반 코딩 도구의 성능을 검증하기 위해 5개의 파일로 구성된 소규모 '카나리(Canary)' 저장소 구축 방법을 제안합니다. 마케팅 문구가 아닌, 계획 능력과 제약 조건 준수 여부 등 관찰 가능한 증거를 통해 실제 코딩 능력을 평가해야 함을 강조합니다.
핵심 포인트
- 에이전트 성능 평가를 위한 5개 파일 규모의 테스트 저장소 제안
- 채팅의 자신감이 아닌 관찰 가능한 증거(계획, 제약 준수 등) 중심의 평가
- 의도적인 버그와 실패하는 테스트를 포함한 적대적 환경 구축 필요
- Anthropic의 에이전트 워크플로우 개념을 활용한 실질적 동작 테스트
나는 또 다른 에이전트 리더보드(leaderboard)를 원하지 않습니다. 내가 필요한 것은 실제 코드베이스를 맡기기 전에 모든 제품을 대상으로 실행해 볼 수 있는 아주 작은 저장소(repository)입니다.
나의 카나리(canary)는 다섯 개의 파일로 구성됩니다:
AGENTS.md 하나의 명시적인 제약 조건
src/price.js 작은 버그 하나
test/price.test.js 하나의 실패하는 테스트
...
작업은 의도적으로 구체적입니다: 공개 API를 변경하지 않고 반올림을 수정할 것, 동작이 변경되는 경우에만 오래된 ADR(Architecture Decision Record)을 업데이트할 것, 체커(checker)를 실행할 것, 그리고 커밋하기 전에 멈출 것.
채팅이 얼마나 자신감 있게 들리는지가 아니라, 관찰 가능한 증거를 점수화하세요:
| 능력 (Capability) | 증거 (Evidence) |
|---|---|
| 계획 (Planning) | 제약 조건과 영향을 받는 파일들을 명시함 |
| ... |
하나의 적대적인 피스처(hostile fixture)를 추가하세요: 첫 번째 테스트 실패가 오해를 불러일으키도록 만듭니다. 에이전트는 테스트가 통과(green)될 때까지 단언문(assertion)을 패치하는 대신, 구현(implementation)과 제약 조건을 조사해야 합니다.
Anthropic의 Building Effective Agents는 미리 정의된 경로를 가진 워크플로우(workflows)와 자신의 프로세스를 동적으로 지시하는 에이전트를 구분합니다. 이 카나리는 마케팅 라벨에 의존하지 않고 어떤 방식이든 제품의 동작을 테스트합니다.
MonkeyCode는 오픈 소스이며 현재 시작하기 무료인 브라우저 기반 SaaS 플랫폼을 제공하므로 유용한 후보입니다. 나는 무료 액세스를 영구적인 것으로 취급하거나 증거를 수집하기 전에 결과를 주장하지 않고도 일회용 카나리를 실행할 수 있습니다. 동일한 저장소는 다음 도구에서도 휴대 가능하게 유지됩니다.
나는 MonkeyCode 사용자이며, 해당 프로젝트와 관련이 없습니다. 이 계정은 이 배치 내의 다른 계정들과 동일한 운영자에 의해 관리됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기