프로덕션 클라우드 기술(Cloud Skills)은 충분히 테스트되고 있는가? 실제 환경에서의 기술 테스트 커버리지 측정 및 관리
요약
AI 에이전트가 사용하는 클라우드 기술(Cloud Skills)의 테스트 완전성을 측정하기 위한 '기술 테스트 커버리지(Skill Test Coverage)' 개념을 제안합니다. 기존의 성공률 중심 평가를 넘어, 운영 의무를 얼마나 포괄하는지 측정하는 파이프라인과 방법론을 다룹니다.
핵심 포인트
- AI 에이전트용 클라우드 기술의 테스트 커버리지 측정 방법론 제안
- 단순 성공률 측정을 넘어 운영 의무(operational obligations) 기반의 커버리지 정의
- 자연어 기술 패키지에서 커버리지를 추출하는 측정 파이프라인 개발
- 모델 보조 후보 생성과 전문가 검토를 결합한 신뢰성 확보
- 커버리지 격차를 기반으로 한 테스트 개선 권장 사항 생성
클라우드 플랫폼은 AI 에이전트가 클라우드 리소스를 생성, 구성, 모니터링 및 트러블슈팅(troubleshooting)할 수 있도록 안내하는 재사용 가능한 클라우드 기술(Cloud Skills)을 점점 더 많이 제공하고 있습니다. 워크플로 중심의 기술(Workflow-oriented Skills)은 여러 리소스 작업, 사용자 선택, 검증 단계 및 복구 동작을 지정합니다. 기존의 기술(Skill) 평가는 주로 기술이 작업 성공률을 향상시키는지 여부를 측정합니다. 그러나 사용 가능한 테스트 케이스(testcases)를 통과한다고 해서, 해당 기술에 의해 지정된 어떤 동작들이 한 번도 테스트되지 않았는지는 드러나지 않습니다. 본 논문은 기술의 테스트 스위트(test suite)가 운영 테스트 의무(operational test obligations)를 얼마나 완전하게 커버하는지를 측정하는 기술 테스트 커버리지(Skill Test Coverage)를 소개합니다. 우리는 커버리지 단위(coverage units), 테스트 케이스 커버리지 관계(testcase coverage relation), 계산 절차(calculation procedure) 및 주장 경계(claim boundary)를 정의합니다. 이러한 단위와 연결 관계는 자연어 기술(Skill) 패키지에서 명시적이지 않기 때문에, 우리는 운영 의무를 복구하고, 워크플로 컨텍스트(workflow context)를 구성하며, 사용자 프롬프트(user prompts)와 초기 리소스 상태를 모두 사용하여 테스트 케이스를 매핑하고, 감사 가능한 커버리지 보고서(auditable coverage report)를 생성하는 측정 파이프라인을 개발합니다. 모델 보조 후보 생성(Model-assisted candidate generation)은 전문가 검토(expert review)와 결합되어 보고된 커버리지가 원래의 기술 및 테스트 케이스 증거에 근거하도록 보장합니다. 이후 검토 후 모듈(post-review module)은 확인된 커버리지 격차(coverage gaps)를 소스에 기반한 테스트 개선 권장 사항으로 변환합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기