
agency-agents를 Codex로 테스트했더니 CI를 통과한 구현이 'NEEDS WORK'가 되었다
요약
agency-agents의 전문 에이전트들을 Codex에 도입하여 CI를 통과한 PR의 품질을 검증한 실험 사례입니다. Code Reviewer, Security Engineer 등 역할을 세분화하여 테스트한 결과, 테스트 통과 후에도 개선이 필요한 지점들을 발견했습니다.
핵심 포인트
- agency-agents의 전문 프롬프트를 Codex 커스텀 에이전트로 변환하여 적용 가능
- 역할별(리뷰어, 보안, 접근성 등) 에이전트 구동을 통해 다각도 검증 수행
- CI 통과 및 테스트 완료 후에도 에이전트가 'NEEDS WORK' 판정을 내릴 수 있음
- 단순 코드 생성을 넘어 품질, 안전성, 접근성 관점의 피드백 확보 가능
계기는 「agency-agents의 144개 에이전트는 『어디까지 쓸 수 있는가』를 진지하게 조사해 보았다」라는 기사였다.
기사를 읽고, agency-agents의 전문 에이전트를 Codex에 도입하여 자신의 리포지토리(Repository)에서 테스트해 보기로 했다.
실험 대상으로 개인적으로 개발 중인 워크아웃용 프라이빗 앱(Private App)을 선택했다.
검증 대상 PR(Pull Request)에서는 34개 파일을 변경했으며, Biome, 타입 검사, OpenAPI 생성, 401건의 테스트를 통과한 상태였다.
생성 AI가 제안하는 트레이닝 메뉴에는 후보 종목에 대한 검증도 포함되어 있어, 적어도 대충 만든 변경 사항은 아니었다.
CI(Continuous Integration)가 모두 통과된 PR이라면, 이제 차이점(Diff)을 읽고 머지(Merge)해도 되는 것일까.
그럼에도 불구하고 agency-agents에 의한 최종 판정은 NEEDS WORK가 되었다.
전문 에이전트를 4가지 역할로 압축
agency-agents는 역할, 판단 기준, 작업 절차, 결과물을 정의한 전문 프롬프트(Prompt) 모음이다.
참조 기사 공개 시점에는 144종류로 소개되었으나, 2026년 7월 26일에 공식 변환 스크립트를 실행하자 269종류의 에이전트가 Codex용으로 변환되었다.
확인한 agency-agents의 커밋(Commit)은 8ef4923이다.
269종류를 모두 동시에 호출할 필요는 없다.
이번 대상은 생성 AI 기능을 포함한 Web 앱의 PR이다.
다음 4가지 역할을 선택했다.
| 역할 | 담당 |
|---|---|
| Code Reviewer | 차이점의 정확성, 회귀(Regression), 유지보수성, 테스트 부족 |
| ... |
Code Reviewer는 구현과 동작의 관계를 확인하고, Application Security Engineer는 신뢰할 수 없는 입력과 출력을 탐색한다.
Accessibility Auditor는 이용자의 조작을 방해하는 부분을 찾는다.
Reality Checker에는 다른 3가지 역할과 구현자가 놓친 문제를 찾는 역할을 부여했다.
Codex에 프로젝트 한정으로 도입하기
agency-agents의 공식 리포지토리에는 Codex의 커스텀 에이전트용 TOML로 변환하는 스크립트가 준비되어 있다.
글로벌 설정이 아니라 작업 리포지토리의 .codex/agents/에 도입했다.
git clone https://github.com/msitarzewski/agency-agents.git
cd agency-agents
git checkout 8ef4923
...
도입한 것은 Agent Skills 형식의 SKILL.md가 아니라, Codex의 커스텀 에이전트이다.
Code Reviewer, Application Security Engineer, Accessibility Auditor를 병행하여 구동하고, 수정과 테스트 후에 Reality Checker에게 판정을 맡겼다.
전문 에이전트로부터의 피드백
- Code Reviewer: 구현 전체를 읽고 상태 관리와 테스트 설계의 부족을 지적함
- Application Security Engineer: AI 생성 결과의 취급을 조사하고, 예상치 못한 형식이나 값을 안전하게 거부하도록 제안함
- Accessibility Auditor: 폼(Form)과 표시를 확인하고, 보조 기술에 상태가 전달되는 구조를 제안함
- Reality Checker: 수정 후를 재검증하여 기존 테스트가 놓친 이상한 생성 결과를 지적함
역할을 나눔으로써 동일한 변경 사항을 품질, 안전성, 접근성, 실제 동작이라는 서로 다른 관점에서 확인할 수 있었던 점이 좋았다.
피드백을 반영하여 수정과 11건의 테스트를 추가했다.
테스트가 늘어나도 판정은 변하지 않았다
지적 사항을 수정하고 재판정해도, Reality Checker는 NEEDS WORK (머지 비권장)를 유지했다.
남은 것은 API 이용 제어, 생성 결과의 보증, 데이터 설계, 운용, 접근성, 유지보수와 관련된 과제였다.
모두 국소적인 수정으로는 해결할 수 없기 때문에, 이번에는 영향을 판단할 수 있는 범위 내에서만 수정하고 설계 변경은 보류했다.
전문 프롬프트는 관찰 범위를 바꾼다
agency-agents를 사용하여 얻은 효과는 에이전트의 직함이 늘어난 것이 아니다.
동일한 차이점을 코드 품질, 안전성, 접근성, 검증 결과라는 서로 다른 기준으로 평가할 수 있었다는 점이다.
확인되지 않은 과제를 제시하고, 안이한 승인을 막는 전문가를 품질 게이트(Quality Gate)로서 도입할 수 있었다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기