AI 에이전트를 위한 CI/CD 파이프라인 완성: 3가지 새로운 기술이 어떻게 핵심 공백을 채웠는가
요약
AI 에이전트 개발을 위한 CI/CD 파이프라인의 공백을 메우는 세 가지 핵심 기술(SunMao, ShaLuang, DuoSheng)을 소개합니다. 수락 기준 정의, 다각도 사용자 테스트, 출시 후 피드백 수집을 통해 에이전트의 신뢰성을 높이는 방법을 다룹니다.
핵심 포인트
- SunMao를 통해 실행 전 수락 기준과 해시 검증으로 결과물 무결성 확보
- ShaLuang의 7가지 사용자 아키타입을 활용한 다각도 스트레스 테스트 도입
- 시뮬레이션 데이터와 실제 사용자 피드백의 명확한 분리 필요성 강조
- 출시 후 공개된 신호를 체계적으로 수집하는 DuoSheng 기술 적용
AI 에이전트를 위한 CI/CD 파이프라인 완성: 3가지 새로운 기술이 어떻게 핵심 공백을 채웠는가
문제점: 끊어진 파이프라인
이전 기사들에서 우리는 AI 에이전트를 위한 Lianzhu의 5단계 CI/CD 프레임워크에 대해 논의했습니다. 하지만 공백이 있었습니다. 파이프라인 내의 세 가지 핵심 직무가 비어 있었습니다.
5단계: 전과 후
| 단계 | 기술 | 이전 상태 | 현재 상태 |
|---|---|---|---|
| 경로 정의 (Route Definition) | QuanYan·Source Seeking | 활성화 (Live) | 활성화 (Live) |
| ... |
파이프라인은 수락 기준 (acceptance criteria), 테스트 (testing), 피드백 (feedback) 단계에서 끊어져 있었습니다. Lianzhu로 AI 에이전트 작업을 실행할 때, 요구사항을 정의하고 QA 체크를 수행할 수는 있었지만, 수락 기준을 검증하거나, 다양한 사용자 관점에서 테스트하거나, 실제 환경의 신호 피드백을 수집할 공식적인 방법이 없었습니다.
SunMao: 실행 전 수락 기준 정의
채워진 공백: 수락 기준 (acceptance criteria)은 항상 사후에 추가됩니다.
아마 이런 시나리오를 경험해 보셨을 것입니다: 에이전트가 작업을 완료합니다. 당신은 그것을 훑어보고 "이 정도면 됐어"라고 생각하며 배포합니다. 나중에 문제가 발생합니다. 당신은 묻습니다: "수락 기준 (acceptance criteria)이 무엇이었지?" 대답은: 없습니다.
SunMao는 이 워크플로우를 변경합니다:
- 수락 조건 (acceptance conditions)을 먼저 정의하여 요구사항을 실행 가능한 체크 항목으로 변환합니다.
- 실행이 시작되기 전에 성공 및 실패 경로를 확정합니다.
- 파일 매니페스트 (file manifests) 및 해시 (hashes)를 포함하여 결과물이 실행 도중 몰래 수정되지 않았는지 확인합니다.
해시 (hash) 검증은 특히 중요합니다. AI 에이전트는 실행 중에 자신의 작업물을 수정할 수 있으므로, SunMao는 수락 검증 (acceptance validation) 단계에서 승인 전 무단 변경 사항을 포착하도록 보장합니다.
ShaLuang: 출시 전 스트레스 테스트
채워진 공백: 내부 테스트는 실제 사용자 관점을 대체할 수 없습니다.
이전의 Lianzhu 파이프라인은 QA 단계에서 종료되었습니다. 세 가지 QA 게이트는 논리적 오류를 잡아내지만, "나에게는 괜찮아 보이지만 사용자는 싫어하는" 시나리오는 잡아내지 못합니다.
ShaLuang은 다각도 테스트 (multi-perspective testing)를 도입합니다:
- 사전 정의된 7가지 사용자 아키타입 (user archetypes) (다양한 경험 수준 및 서로 다른 사용 사례)
- 각 아키타입은 서로 다른 사각지대를 드러냅니다:
- 신규 사용자는 용어 문제로 어려움을 겪음
- 파워 유저 (Power users)는 기본 설정에서의 엣지 케이스 (edge cases)에 직면함
- 작업 중심 사용자는 선택 사항이지만 유용한 단계를 건너뜀
- 시뮬레이션된 피드백 (simulated feedback)과 실제 사용자 데이터 (real user data) 사이의 명확한 분리
이러한 구분은 매우 중요합니다. 많은 에이전트 테스트 프레임워크가 시뮬레이션 결과와 실제 사용자 피드백을 혼동하여, 잘못된 데이터에 기반한 의사결정을 내리곤 합니다. ShaLuang은 이 경계를 유지합니다. 시뮬레이션은 명백한 문제를 노출하고, 실제 사용자 피드백은 별도로 수집해야 합니다.
DuoSheng: 내부의 환호가 아닌, 공개된 신호에 귀를 기울여라
해결하는 공백: 출시 후 피드백을 수집하는 체계적인 방법의 부재.
처음 4단계의 Lianzhu 단계는 완전히 내부적으로 완료됩니다. 하지만 출시 후에는 어떻게 될까요? 당신의 Skill이 라이브 상태가 되고, 사용자들이 상호작용하며, 온라인에서 논의가 발생합니다. 이러한 신호들을 어떻게 체계적으로 수집하여 개발 과정으로 다시 피드백할 수 있을까요?
DuoSheng은 이 문제를 해결합니다:
- ShaLuang의 테스트 질문을 **공개 검색 쿼리 (public search queries)**로 변환
- 각 발견 사항을 출처, 타임스탬프, 신뢰도 점수와 함께 기록
- 검증된 신호를 개발의 기점(origin point)으로 다시 전달
- 정책: 내부의 축하가 아닌, 외부의 메아리에만 귀를 기울일 것
내부 테스트 데이터는 사용하지 않습니다. 오직 공개된 소스만을 사용합니다. 모든 신호는 무조건적으로 수용되는 것이 아니라 출처(provenance)와 함께 기록됩니다.
이는 실질적인 가치를 지닙니다. Skill이나 기능을 출시한 후 사용자들이 어떻게 생각하는지 궁금할 때, 전체 수동 검색 사이클은 몇 시간이 걸립니다. DuoSheng은 이 워크플로우를 표준화합니다.
이제 완성된 전체 파이프라인
세 가지 Skill이 모두 활성화됨에 따라, Lianzhu 파이프라인은 이제 완성되었습니다:
QuanYan (경로 정의)
→ SunMao (수락 정의)
→ CuiLu (품질 검사 실행)
...
이는 CI/CD의 베스트 프랙티스 (best practices)를 반영합니다. 각 단계는 명확한 입력(input)과 출력(output)을 가집니다. 무언가 실패했을 때, 당신은 정확히 어느 단계를 디버깅해야 하는지 알 수 있습니다.
사용 방법
세 가지 새로운 기술(Skills) 모두 MCP를 통해 사용할 수 있습니다. 귀하의 MCP 설정에 https://mcp.tancoai.com/mcp를 추가하고 discover_skills를 호출하여 전체 툴킷(toolkit)을 확인해 보세요.
개별 사용: 특정 요구 사항에 따라 각 기술(Skill)을 이름으로 호출하십시오.
체인(chain)으로 사용: 다섯 단계를 자동으로 순차적으로 오케스트레이션(orchestrate)하는 Lianzhu를 호출하십시오.
신규 사용자는 5개의 무료 완전 작업 크레딧(complete-task credits)을 받게 됩니다. 실제 작업을 통해 5단계 파이프라인(pipeline) 전체를 경험해 보기에 완벽합니다.
전체 Lianzhu 툴킷(toolkit) 탐색:
- GitHub: https://github.com/tancoai/lianzhu-skill
- Platform: https://tancoai.com
파이프라인(pipeline)이 완성되었습니다. 이제 귀하의 AI 에이전트(AI agent) 워크플로(workflow)를 더욱 예측 가능하게 만들 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기