품질 낮은 결과물의 배포를 거부하는 AI 리뷰 스킬을 구축한 방법
요약
저품질 AI 생성물(AI slop)을 방지하기 위해 개발된 에이전트 스킬 'revüe'를 소개합니다. 이 도구는 로컬 검증기, 스키마, 자동화된 평가 케이스를 결합하여 AI의 결과물을 엄격하게 검토하고 배포 여부를 결정합니다.
핵심 포인트
- revüe는 Claude Code, Codex 등을 위한 MIT 라이선스 기반 에이전트 스킬임
- 모델의 판단과 결정론적 규칙을 결합하여 배포 여부를 4단계로 판결함
- 디자인 시스템 락을 통해 브랜드 가이드라인 준수 여부를 자동 검증함
- 108개의 자동화된 평가 케이스와 레드팀 요소를 통해 미세한 위반 사항을 탐지함
품질 낮은 결과물의 배포를 거부하는 AI 리뷰 스킬을 구축한 방법
AI 슬롭 (AI slop, 저품질 AI 생성물)을 만드는 가장 빠른 방법은 나쁜 모델을 사용하는 것이 아닙니다. 그것은 다듬어진 초안을 작업이 완료되었다는 증거로 받아들이는 것입니다.
그러한 실패는 어디에서나 나타납니다. 랜딩 페이지가 거의 맞지만 틀린 브랜드 색상을 사용하거나, 캠페인이 설득력 있는 지표를 지어내거나, 프리미엄 디자인이 실제로는 간격만 더 나은 일반적인 템플릿인 경우입니다. 이때 AI 리뷰어는 자신만만한 "좋아 보입니다"라는 말로 문제를 더욱 악화시킵니다.
저는 초안과 배포 결정 사이에 재현 가능한 게이트 (gate)를 두기 위해 revüe를 구축했습니다.
revüe는 Claude Code, Codex, Cowork를 위한 MIT 라이선스 기반의 에이전트 스킬 (Agent Skill)입니다. 이는 리뷰 워크플로우 (review workflow)를 로컬 검증기 (local validators), 스키마 (schemas), 예시, 그리고 108개의 자동화된 평가 (eval) 케이스와 결합합니다. 핵심적인 설계 선택은 간단합니다:
모델이 판단을 담당하게 하라. 결정론적 규칙 (deterministic rules)은 실행 가능하게 만들어라.
판결은 계약이다
revüe 실행은 ship (배포), ship with changes (수정 후 배포), caution (주의), 또는 block (차단) 중 하나의 판결로 끝납니다.
엄격한 검증 (strict validation) 상황에서, 필수 증거가 누락되었거나 감사 (audit)에 실패하면 ship은 허용되지 않습니다. 모델은 단순히 안심시키는 문단을 작성하고 작업이 준비되었다고 말할 수 없습니다. 모델의 결정은 기록된 증거 및 감사 상태와 일치해야 합니다.
모든 non-ship (비배포) 판결에는 배포를 위한 소유자 태그가 지정된 경로가 필요합니다. 이는 리뷰 시스템이 작업을 종결하지 않은 채 인상적인 우려 사항 목록만 나열하는 것을 방지합니다.
브랜드 시스템을 잠금 장치로 전환하기
디자인 및 마케팅 제작을 위해, revüe는 디자인 시스템 락 (design-system lock)을 사용합니다. 이는 승인된 색상, 글꼴 패밀리 (font families), 주장 (claims), 금지된 패턴, 그리고 구조적 규칙을 정의할 수 있습니다.
출력 검증기 (output validator)는 해당 락을 기준으로 실제 HTML 결과물을 검사합니다. 모델에게 승인된 팔레트를 기억하도록 요청하는 것도 유용하지만, 그것은 모델이 실제로 작성한 아티팩트 (artifact)를 직접 확인하는 것과는 다릅니다.
왜 감사에 적대적 요소가 필요했는가
첫 번째 버전은 명백한 위반 사항을 잡아냈습니다. 레드팀 (red-team) 고정 요소들은 덜 명백한 위반 사항을 잡아내도록 모델을 학습시켰습니다.
현재 스위트 (suite)에는 HSL 또는 현대적인 RGB 구문을 통해 표현된 아슬아슬한 색상(near-miss colors), CSS 변수 뒤에 숨겨진 팔레트 외 색상, base64 SVG에 임베디드된 색상, 엔티티(entities) 또는 제로 너비 문자(zero-width characters)로 분리된 금지된 카피, 승인되지 않은 메트릭 (metrics), 위조된 감사 객체 (audit objects), 숨겨진 히어로 (hidden heroes), 그리고 추측된 값이 표시되는 동안 숨겨진 플레이스홀더 (placeholders) 등이 포함되어 있습니다.
발견된 각 우회(bypass) 사례는 영구적인 회귀 테스트 (regression test)가 됩니다. CI는 모든 푸시 (push) 및 풀 리퀘스트 (pull request) 시 108개의 케이스를 모두 실행합니다.
'Clean'은 'Premium'과 같지 않습니다
가장 유용했던 실패 사례 중 하나는 브랜드 위반 사항이 아니었습니다. 그것은 'Premium'으로 선언되었으나 'Clean' 상태인 템플릿이었습니다.
해당 페이지는 승인된 색상을 사용했고 구조적 검사를 통과했습니다. 하지만 플래그십 경험에 기대되는 장인 정신 (craft)은 여전히 부족했습니다. 이로 인해 세 가지 명시적인 티어 (tier)가 생겨났습니다:
- Standard: 깔끔하고, 브랜드 가이드에 맞으며, 잠금 감사 (lock-audited)를 거친 상태.
- Premium: Standard의 모든 사항에 추가적인 편집 장인 정신 (editorial craft) 프로필이 더해진 상태.
- Custom: 명시적인 승인 (signoff)이 필요한 인간 주도의 기준.
Premium 작업은 풀 블리드 히어로 (full-bleed hero), 디스플레이/본문 타이포그래피 대비 (display/body typography contrast), 반복되는 시그니처 모티프 (signature motif), 그리고 지속적인 액션 처리 (persistent action treatment)를 포함하여, 해당 프로필의 기계로 관찰 가능한 부분들을 검사합니다. 이러한 검사들이 디자이너를 대체하는 것은 아닙니다. 다만 시스템이 준수 (compliance)를 장인 정신 (craft)과 동일시하는 것을 방지합니다.
신뢰 경계 (trust boundary)를 작게 유지하십시오
검증기 (validators)는 Python의 표준 라이브러리만을 사용합니다. 네트워크 연결, API 키, 또는 자격 증명 저장소 (credential store)가 필요하지 않습니다. 이들은 로컬 아티팩트 (artifacts)를 읽고 로컬 결과물을 작성합니다.
이는 의도된 설계였습니다. 리뷰 게이트 (review gate)는 의존성 (dependencies)과 데이터 경계가 작을 때 더 신뢰하기 쉽습니다. 또한 이는 스위트를 CI에서 실행하거나 독립형 설치 프로그램 (self-contained installer) 내부에서 실행하기 쉽게 만듭니다.
하나의 워크플로우를 에이전트 런타임 (agent runtimes) 전반에 패키징하십시오
루트(root)의 SKILL.md에는 이 휴대 가능한 워크플로우가 포함되어 있습니다. 지원 자료는 references에, 스키마 (schemas)와 템플릿 (templates)은 assets에, 그리고 결정론적 검사 (deterministic checks)는 scripts에 위치합니다.
Claude Code 사용자는 이 저장소(repository)를 플러그인 마켓플레이스(plugin marketplace)로 설치합니다. Codex 사용자는 스킬(skill)을 수동으로 설치하거나 독립형 설치 프로그램(self-contained installer)을 통해 설치할 수 있습니다. 동일한 명령 계층(instruction layer)은 Cowork에서도 작동합니다.
다음 단계
어떤 검증기(validator)도 미래의 모든 우회(evasion)를 잡아낼 수는 없습니다. 유용한 로드맵은 구체적인 실패 사례로부터 나옵니다:
- 우회 보고(bypass reports)를 최소한의 피스처(fixtures)로 수집합니다.
- 검증기(validator)를 변경하기 전에 실패하는 평가(eval)를 추가합니다.
- 가장 작은 결정론적 수정(deterministic fix)을 수행합니다.
- 판단(judgment) 비중이 높은 검사들은 가짜 확신(fake certainty)이 아닌 판단으로서 명시적으로 유지합니다.
- 공개적인 카운터(counter)가 뒷받침될 때만 채택 수치(adoption numbers)를 게시합니다.
마지막 포인트가 중요한 이유는 이 프로젝트가 Corriston Consulting을 위한 컨설팅 증거(consulting proof)이기도 하기 때문입니다. 이 저장소(repository)는 우리가 판매하는 운영 원칙을 입증해야 합니다: AI의 속도는 품질 기준(quality bar)이 명확하고, 테스트 가능하며, 그 한계에 대해 정직할 때에만 가치가 있습니다.
직접 사용해보고 망가뜨려 보세요
코드, 예제, 그리고 평가 스위트(eval suite)는 MIT 라이선스 하에 공개되어 있습니다:
https://github.com/gcorrist66/revue-proof-workflow-skill
revüe가 도움이 된다면 저장소(repository)에 스타(star)를 눌러주세요. 만약 잘못된 작업이 통과된다면, 우회(bypass)를 재현할 수 있는 가장 작은 아티팩트(artifact)와 함께 이슈(issue)를 생성해 주세요.
브랜드 시스템, 승인 규칙, 그리고 클라이언트 인계(client handoffs)를 중심으로 '증거 우선(proof-first)' 워크플로우가 필요한 팀이라면, 그것이 바로 Corriston Consulting이 수행하도록 구축된 컨설팅 업무입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기