
Gemini Enterprise Agent Platform과 Genkit Go로 AI 개발 검증 체계가 진화하다
요약
Google이 Gemini Enterprise Agent Platform의 평가 서비스 GA와 Genkit Go의 Agent Skills 기능을 발표했습니다. 이를 통해 AI 에이전트의 품질 검증을 일원화하고, 필요한 시점에만 지식을 로드하여 컨텍스트 효율성을 높일 수 있습니다.
핵심 포인트
- Gemini 평가 서비스 GA로 개발과 운영 단계의 품질 측정 일원화 가능
- Eval-Prod Gap(개발-운영 간 품질 격차) 문제 해결 지원
- Genkit Go의 Agent Skills를 통한 단계적 정보 공개로 토큰 비용 절감
- SKILL.md 모듈화를 통한 에이전트 컨텍스트 관리 효율화
2026년 7월 31일, Google Developers Blog로부터 AI 에이전트 개발과 관련된 중요한 발표가 2건 있었습니다.
Gemini Enterprise Agent Platform의 평가 서비스(Agent/Model Evaluations)가 일반 제공(GA, General Availability) 시작 -
Genkit Go에, 필요할 때만 전문 지식을 읽어들이는 Agent Skills 기능 추가
두 발표 모두 "AI 에이전트를 어떻게 만드는가"가 아니라 "AI 에이전트의 품질을 어떻게 담보할 것인가·어떻게 효율적으로 확장할 것인가"라는, 실운용 단계에서 직면하는 과제에 응답하는 내용입니다. 특히 평가 서비스의 GA는, 지금까지 각 기업이 자체적으로 구축해 왔던 "개발 시의 실험 평가"와 "본방 트래픽의 품질 모니터링"을 일원화할 수 있다는 점에서, 에이전트 개발의 운영 비용과 직결되는 변경 사항입니다.
📌 영향을 받는 사람
- Gemini Enterprise Agent Platform 상에서 에이전트를 개발·운용하고 있는 팀
- Genkit Go로 에이전트를 구축하고 있으며, 문서나 도구 정의의 비대화로 고민하고 있는 개발자
- CI/CD 파이프라인에 에이전트의 품질 테스트를 포함시키고 싶은 사람
이번 두 가지 변경 사항은 모두 "에이전트에 전달하는 정보를, 필요한 타이밍과 필요한 범위만큼만 다룬다"는 사상으로 연결되어 있습니다. 평가 서비스는 품질 정보를, Agent Skills는 전문 지식을 각각 "온디맨드(On-demand)화"하고 있습니다.
평가 서비스 측은 "개발~본방의 일관된 측정", Genkit Go 측은 "단계적 공개(Progressive Disclosure)를 통한 컨텍스트 절약"이라는, 각각 서로 다른 레이어에서의 효율화로 이해하면 쉽습니다.
Gemini Enterprise Agent Platform의 evaluation service가 정식 출시되었습니다. 주요 포인트를 정리합니다.
| 항목 | 내용 |
|---|---|
| 대상 범위 | 로컬 개발 실험 + 본방 가동 중인 라이브 트래픽 |
| ... |
지금까지 "개발 중에 프롬프트를 수동으로 평가하는 메커니즘"과 "본방에서의 모니터링"은 별개의 도구로 구축되는 경우가 많아, 평가 기준이 어긋나는 문제가 있었습니다. GA 버전은 동일한 엔진과 동일한 메트릭(Metrics) 정의를 양쪽 단계 모두에서 사용할 수 있기 때문에, 개발 시에는 좋았던 에이전트가 본방에서 저하되는(Eval-Prod Gap) 전형적인 문제를 검지하기 쉬워집니다.
Genkit Go에 progressive disclosure(단계적 공개) 아키텍처에 기반한 Agent Skills가 추가되었습니다.
- 지시·스크립트·참조 자료를
SKILL.md번들로서 모듈화 - 통상 시에는 프런트매터(Frontmatter)의 메타데이터만이 시스템 프롬프트에 공개됨 - 태스크가 스킬의
description에 매치되는 순간, Genkit의 미들웨어가 본문과 에셋을 동적 로드
이는 에이전트에 대량의 도구 정의나 매뉴얼을 상시 읽히게 함으로써 컨텍스트 윈도우(Context Window)를 압박하고, 토큰 비용이 증가하는 문제에 대한 대책입니다.
💡 Tips
두 변경 사항 모두 기존 워크플로우를 깨뜨리는 파괴적 변경(Breaking Change)은 아닙니다. 기존의 에이전트 구현은 그대로 동작합니다.
Agent Platform을 사용 중인 팀: 독자적으로 구축해 왔던 평가 스크립트나 CI의 커스텀 저지(Custom Judge)를 GA 버전의 evaluation service로 통합할 수 있을지 검토할 가치가 있습니다. 특히 "개발 시 테스트와 본방 모니터링의 메트릭 정의가 일치하지 않는" 경우에는 통합할 좋은 기회입니다.
- Genkit Go로 에이전트를 개발 중인 팀: 도구나 문서가 많아 시스템 프롬프트가 비대해진 경우,
SKILL.md로 분리함으로써 토큰 비용을 절감할 수 있을 가능성이 있습니다. - 지금 바로 대응이 필수적인 것은 아닙니다 (
action_required: false). 다만 중장기적으로 에이전트 운영 비용에 영향을 미치므로, 다음 스프린트의 검증 후보로 두는 것이 좋습니다.
# 로컬 실험과 본방 트래픽에 동일한 메트릭 세트를 적용하는 예
agents-cli eval run \
--agent my-support-agent \
...
동일한 메트릭 정의(response_quality 등)를 레지스트리에서 일원 관리함으로써, 개발 시와 본방에서 평가 기준이 어긋나는 것을 방지할 수 있습니다.
Before (모든 도구 정의 및 모든 매뉴얼을 항상 시스템 프롬프트에 포함)
// 모든 스킬의 상세 지침을 매번 프롬프트에 포함함
systemPrompt := loadFullSkillInstructions("refund-policy") +
loadFullSkillInstructions("shipping-policy") +
...
After (프론트매터(Frontmatter)만 공개하고, 필요할 때 본문을 로드)
# skills/refund-policy/SKILL.md
---
name: refund-policy
...
// 프론트매터만 초기 공개되며,
// 태스크가 description에 매치되는 시점에 Genkit 미들웨어가 본문을 동적 로드함
agent := genkit.NewAgent(
...
이를 통해 시스템 프롬프트에는 각 스킬의 name과 description만 포함되며, 실제로 해당 스킬이 필요해진 시점에 본문이 읽히기 때문에 사용되지 않는 스킬에 대한 토큰 소비를 억제할 수 있습니다.
Gemini Enterprise Agent Platform의 evaluation service가 GA(General Availability)가 되어, 개발부터 운영까지 일관된 기준으로 측정할 수 있는 평가 엔진을 사용할 수 있게 되었습니다. 20개 이상의 내장 메트릭(Metrics), DeepMind의 어댑티브 루브릭(Adaptive Rubric), 시뮬레이터를 통한 멀티턴 테스트(Multi-turn test) 자동화가 핵심입니다.
Genkit Go의 Agent Skills를 통해 SKILL.md를 점진적 공개(Progressive disclosure) 방식으로 관리하여, 컨텍스트 비대화와 토큰 소비를 억제할 수 있게 되었습니다.
두 기능 모두 파괴적 변경(Breaking change)이 아니며 기존 구현에 미치는 영향은 없으나, 평가 기반의 통일이나 컨텍스트 최적화라는 관점에서 중장기적으로 에이전트 운영 비용을 좌우할 변경 사항입니다. 다음 로드맵 검토 시 후보로 고려해 두어야 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기