
비하인드 스토리: Google Agent Skills를 구축, 테스트 및 확장하는 방법
요약
Google Agent Skills 프로젝트의 탄생 배경과 구축 과정을 다룹니다. Google Cloud 도메인 지식을 구조화된 지침으로 변환하여 AI 에이전트의 정확도와 안전성을 높이는 방법론을 공유합니다.
핵심 포인트
- Google Cloud 지식을 구조화된 오픈 소스 지침으로 인코딩
- AI 에이전트의 환각 현상 감소 및 베스트 프랙티스 강제
- 대규모 기여 환경에서 일관된 품질 관리 및 거버넌스 유지의 중요성
AI 에이전트 (AI agents)의 성능은 여러분이 제공하는 지침 (instructions)과 컨텍스트 (context)에 달려 있습니다. 우리가 Google Agent Skills를 출시했을 때, 우리의 목표는 간단했습니다. Google Cloud 도메인 지식을 구조화된 오픈 소스 지침으로 인코딩하여 AI 코딩 에이전트 (AI coding agents)를 훨씬 더 똑똑하고, 안전하며, 정확하게 만드는 것이었습니다.
오늘 저는 여러분을 Google Agent Skills의 비하인드 스토리로 안내하고자 합니다. 이 기술들을 직접 다루는 팀 구성원으로서, 우리가 어떻게 시작했는지, 대규모 환경에서 어떻게 품질을 유지하는지, 그리고 공개 및 내부 기술에 대한 거버넌스 (governance)를 어떻게 처리하는지 공유하겠습니다.
시작 단계: Next'26 킥오프 스웜 (swarm)
Google Agent Skills 프로젝트는 진공 상태에서 시작된 것이 아닙니다. 이 프로젝트는 Google Cloud Next 2026을 앞두고 빠르게 진행된 "스웜 (swarm)" 노력으로 시작되었습니다.
Developer Advocates와 Technical Writers가 이끄는 교차 기능 태스크 포스 (cross-functional task force)가 모여 명확한 목표를 세웠습니다. 바로 Google Cloud 도메인 지식을 구조화되고 에이전트가 읽을 수 있는 지침으로 패키징하는 것이었습니다.
출시는 공식 Google Agent Skills 출시 포스트를 통해 발표되었습니다. 초기 커뮤니티의 반응은 15,000개 이상의 GitHub 스타를 기록하며 우리의 기대치를 뛰어넘었습니다!

Google 내부 및 외부의 개발자와 엔지니어링 팀들이 기술 (skills)이 AI 에이전트를 얼마나 효과적으로 가이드하는지(환각 (hallucinations)을 줄이고 베스트 프랙티스 (best practices)를 강제함) 확인한 후, 많은 이들이 참여하기를 원했습니다. 곧이어 많은 제품 팀들이 자신들의 Google 서비스(Cloud에 국한되지 않고 Ads 등 포함)를 위한 기술을 기여하고 싶어 하는 물결이 일었습니다.
과제: 품질을 유지하면서 확장하기
인기는 큰 과제를 동반합니다. 바로 품질 관리 (quality control)입니다.
서로 다른 팀들이 기술 (skills)을 기여할 때, 일관된 표준을 유지하는 것은 매우 어려운 일이 됩니다. 모호한 지침, 깨진 링크, 또는 누락된 엣지 케이스 (edge cases)를 포함한 품질 낮은 기술은 에이전트 경험 전체를 저하시킵니다.
개발자 경험 (developer experience)을 보호하면서도 팀들이 기술을 게시할 수 있도록 하기 위해, 우리는 **매우 높은 기준 (very high bar)**을 설정해야 했습니다.
이는 프로세스가 매우 중요하다는 것을 의미합니다. 명확한 표준과 자동화된 거버넌스 (governance)가 없다면, 오픈 소스 기술 저장소는 금세 혼란에 빠지게 됩니다.
그럼 이제 규모를 확장하면서 어떻게 품질을 유지하는지 그 세부 사항을 살펴보겠습니다.
Agent Skill의 구조
수많은 Google 서비스 전반에 걸쳐 기술의 일관성을 유지하기 위해, 모든 기술은 표준화된 저장소 레이아웃 (repository layout)을 따릅니다:
{skill-name}/
├── SKILL.md # 필수: 주요 지침 및 프론트매터 (frontmatter) 메타데이터
├── OWNERS # 필수: 기술 유지 관리자 (내부용으로 유지)
...
아키텍처 베스트 프랙티스 (Architectural best practice): 원격 MCP 도구 선호
기술을 설계할 때 우리의 기본 원칙은 다음과 같습니다: 가능한 한 원격 Model Context Protocol (MCP) 도구를 참조하되, CLI 또는 API 호출은 꼭 필요한 경우에만 보조적으로 사용한다. 원격 MCP 서버는 도구를 제공하는 동시에 내장된 인증 (auth) 및 IAM 거버넌스를 제공하므로, 에이전트 중심의 워크로드 (Agentic workloads)에 가장 적합합니다.
공개 내보내기 (Public export)
우리는 기술이 제대로 작동하고 적절히 검증되었는지 확인하기 위해 먼저 내부적으로 기술을 구축하고 평가합니다. 공개할 준비가 되면, 자동화된 내보내기 규칙을 사용하여 GitHub에 게시합니다. 이를 통해 내부 자산, 소유권 정보 및 평가 스위트 (evaluation suites)를 제거함으로써 공개 저장소를 깔끔하게 유지합니다.
체크인 시 자동 검사
어떤 기술이 저장소에 진입하기 전에, 반드시 자동화된 CI/CD 파이프라인을 통과해야 합니다:
- Linters (린터): 프론트매터 (frontmatter) 메타데이터, 라인 수, 디렉토리 레이아웃 및 엄격한 명명 규칙 (naming conventions)을 검증합니다.
- Link Checkers (링크 체커): 머지 (merge) 전에 404 오류 및 환각 (hallucinated) 링크를 제거하기 위해 링크 검사 도구를 사용하여 모든 URL을 테스트합니다. 힌트: 유사한 솔루션을 구축 중이라면 lychee를 사용해 보길 권장합니다.
- AI-Assisted Checklists (AI 지원 체크리스트): 자동화된 검증 체크를 사용하여 지침이 요구되는 구조적 패턴과 가드레일 (guardrails)을 따르는지 확인합니다.
스킬 린팅을 위한 GitHub Action 예시
우리의 개발은 Google의 내부 도구에 의존하지만, 공개 오픈 소스 스킬 저장소는 CI/CD를 위해 표준 GitHub Actions를 사용할 수 있습니다.
GitHub에서 자체 스킬 라이브러리를 유지 관리하는 경우, 린팅은 높은 품질 기준을 유지하기 위한 더 큰 체크 스위트 (check suite)의 일부입니다. 다음 GitHub Action 설정은 skills-ref를 사용하여 저장소에서 스킬 검증을 자동으로 실행하는 방법을 보여줍니다:
name: 'Validate Skills'
on:
...
지속적인 평가 (제출 시 및 매주)
문서와 API가 진화하듯, LLM 모델과 에이전트 하네스 (agent harnesses)도 진화합니다. 기반이 되는 API, 모델 또는 에이전트 하네스가 변경되면 오늘 작동하는 스킬이 내일은 깨질 수 있습니다.
초기 품질 기준을 설정하고 성능 저하를 방지하기 위해, 우리는 지속적인 평가 (continuous evaluations)를 실행합니다:
- 제출 시 평가 (On-submit evaluations): 작성자는 명시적인 평가 프롬프트 스위트 (evaluation prompt suites)와 채점 루브릭 (scoring rubrics)을 제공해야 합니다. 우리가 출시하는 모든 새로운 스킬은 정확성과 효율성을 보장하기 위해 먼저 내부적으로 평가됩니다.
- 주간 품질 점검 (Weekly quality checks): 회귀 (regressions)를 조기에 발견하기 위해 전체 스킬 라이브러리를 대상으로 지속적이고 예정된 평가 작업을 실행합니다.
스킬 작성자는 프롬프트와 기대값 세트를 포함하는 여러 개의 평가 테스트 케이스를 제공해야 합니다. 각 평가 스위트마다, 우리는 각 스킬이 있을 때와 없을 때의 에이전트 성능을 비교합니다.
그리고 두 가지 주요 차원을 살펴봅니다:
- 정확도 (Accuracy) - 응답 품질 및 작업 완료율
- 효율성 (Efficiency) - 소비된 토큰 수 및 완료 시간
또한, 통계적으로 유의미한 결과를 얻기 위해 다양한 에이전트 프레임워크를 대상으로 평가 (evals)를 여러 번 실행합니다.
최종적으로, 2x2 매트릭스는 특정 스킬이 측정 가능한 수준의 정확도 및 효율성 향상을 제공하는지 증명합니다.

스킬은 스니펫이 아니라 제품입니다
우리의 작업으로부터 얻은 핵심 교훈은 스킬이 일회성 문서가 아니라 살아있는 제품이라는 점입니다.
장기적인 신뢰성을 보장하기 위해, 우리는 엄격한 소유권 규칙을 수립했습니다:
- **리포지토리 유지 관리자 (Repo maintainers)**는 리포지토리의 상태, CI 파이프라인 및 아키텍처 표준을 감독합니다.
- **스킬 소유자 (Skill owners)**는 자신의 스킬을 장기적으로 유지 관리할 책임이 있습니다. 예를 들어, 제품 API가 변경되면 스킬 소유자가 스킬을 업데이트합니다. 평가 실행 중에 발견된 품질 저하에 대해서도 동일하게 적용됩니다.
저자 지원: 도구 및 에이전트 워크플로우 (agentic workflows)
효과적인 지침과 평가 스위트를 작성하려면 연습이 필요하며, 우리는 스킬 저자들이 모든 것을 처음부터 직접 만들어내기를 기대하지 않습니다.
기여자들을 지원하기 위해, 우리는 여러 도구와 에이전트 워크플로우 (agentic workflows)를 구축했습니다:
- 내부 스킬 (Internal skills): 새로운 스킬을 구축하고 견고한 평가를 작성하는 저자들을 돕기 위해 특별히 설계되었습니다.
- 에이전트 도구 (Agentic tools): ADK로 구축되었으며, 저작 및 자기 비판 (self-critique)을 위한 멀티 에이전트 루프를 실행하고 메인 리포지토리로 쉽게 내보낼 수 있는 경로를 제공합니다.
이러한 저작 도구와 에이전트 워크플로우에 대해서는 향후 기사에서 더 자세히 다루겠습니다.
"DevRel Skills"를 통한 내부 효율성
Google Agent Skills가 외부 개발자를 위한 공개 스킬을 호스팅하는 동안, 우리는 DevRel Skills라고 불리는 병렬적인 내부 이니셔티브도 시작했습니다.
DevRel Skills는 특히 내부 팀의 워크플로 (workflows)를 위한 에이전트 스킬 (agent skills)을 구축하는 데 중점을 둡니다. 콘텐츠 변환 (content transformation), SEO 최적화 (SEO optimization), 내부 보고 (internal reporting) 등과 같은 내부 프로세스를 전용 스킬로 인코딩 (encoding)함으로써, 우리는 팀이 매일 더 효과적이고 일관되게 일할 수 있도록 돕습니다.
마무리 및 여러분의 의견을 듣습니다
대규모로 품질 높은 에이전트 스킬을 구축하려면 명확한 표준, 엄격한 평가 (evaluation), 자동화된 CI/CD, 그리고 장기적인 오너십 (ownership)을 결합해야 합니다.
에이전트 기반 개발 (agentic development)이 성장함에 따라, 여러분의 의견을 듣고 싶습니다:
- 여러분의 워크플로에서는 에이전트 스킬을 어떻게 구축하고 테스트하고 계신가요?
- 에이전트의 응답을 검증하기 위해 어떤 체크 (checks)나 평가 (evals)를 사용하시나요?
댓글로 알려주시거나 소셜 미디어를 통해 연락해 주세요!
링크 및 추가 읽을거리
Google Agent Skills를 시작하려면 다음을 확인하세요:
- Google Agent Skills 리포지토리 (Repo): github.com/google/skills
- 파트 1: 소개: Google Cloud Agent Skills란 무엇인가?
- 파트 2: 실전 가이드: 중간 단계 에이전트 스킬 활용하기
다음 단계는?
이 포스트가 도움이 되었다면:
읽어주셔서 감사합니다!
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기