Data Agent Kit으로 데이터 마트를 쉽게 구현하는 방법
요약
Google에서 데이터 마트 구축을 위한 Data Agent Kit이 발표되었습니다. 이 키트는 Model Context Protocol (MCP)과 에이전트 스킬 세트로 구성되어, AI 코딩 에이전트가 BigQuery 등 다양한 Google Cloud 데이터 리소스를 직접 조작할 수 있게 합니다. 이를 통해 복잡한 데이터 파이프라인 구축 및 개발 생산성을 크게 향상시킵니다.
핵심 포인트
- Data Agent Kit은 MCP와 에이전트 스킬로 구성되어 AI 코딩 에이전트를 지원합니다.
- AI가 다양한 Google Cloud 데이터 리소스를 직접 조작할 수 있게 합니다.
- 데이터 분산, 비용 증가, 안전성 확보 등 3가지 과제를 해결하는 아키텍처입니다.
- 개발자에게 데이터 마트 설계 및 파이프라인 코딩을 자동화하여 생산성을 높여줍니다.
서론
Google에서 데이터 마트 구축을 위한 Data Agent Kit이 10/09에 발표되었습니다.
이후 기사에서는 Google Cloud를 중심으로 내용을 전개합니다.
- Data Agent Kit의 개요
Data Agent Kit은 Model Context Protocol (MCP) 툴과 에이전트 스킬의 무료 세트입니다. Antigravity나 Claude Code, Codex 등 이미 사용하고 있는 코딩 에이전트를 Google Cloud 데이터 제품과 직접 연동할 수 있습니다.
Data Agent Kit에 대해서는 Data Engineering Summit 2026 세션 발표 내용에서 개요와 실제 데모를 확인할 수 있었습니다.
주요 특징 및 구성 요소
개요
AI 코딩 에이전트가 Google Cloud의 데이터 리소스를 직접 조작할 수 있도록 하는 Model Context Protocol (MCP) 툴과 에이전트 스킬 세트입니다.
MCP 툴
BigQuery, Spanner, AlloyDB, Cloud SQL, Bigtable, Cloud Storage 등 15개 이상의 Google 데이터 클라우드 서비스에 연결하여 스키마 검사나 쿼리 실행을 수행합니다.
에이전트형 스킬
BigQuery의 SQL 최적화나 dbt 파이프라인 구축과 같은 베스트 프랙티스를 에이전트에게 학습시키는 오픈 소스 지침서입니다.
생성 AI 활용에 따른 데이터 마트 구축
생성 AI 모델 성능이 향상됨에 따라, 기업이 AI를 실무(데이터 분석 등)에서 활용하기 위해서는 '자사 데이터를 안전하고 정확하게 AI가 이해할 수 있는 메커니즘'이 요구됩니다.
AI용 데이터 기반이 안고 있는 3가지 과제와 이를 해결하는 Google Cloud의 3가지 주요 제품 및 이들을 조합한 'SOAP 아키텍처'에 대해 설명합니다.
주요 포인트
AI 시대의 데이터 활용における 3가지 과제

-
정확도의 문제 (데이터 분산 및 다양화): 데이터가 멀티 클라우드나 온프레미스에 산재해 있고, 비정형 데이터(이미지, 음성, 문서 등)도 증가하고 있어 AI가 필요한 데이터를 집약하여 공급하기 어렵습니다.
-
비용의 문제 (토큰 소비 증가): AI에게 복잡한 작업을 시키면 깊은 추론을 실행하는 과정에서 토큰 소비량이 눈에 띄게 늘어나 막대한 인프라 비용이 발생합니다.
-
안전성 및 거버넌스: 보안(가드레일)을 지키면서 산재된 데이터를 AI와 연동해야 합니다.
과제를 해결하는 Google Cloud의 3가지 제품

- 경계 없는 레이크하우스 (멀티 클라우드 대응): 타사 클라우드(AWS S3 등)에 있는 데이터를 물리적으로 이동시키지 않고(제로 카피로) Google Cloud 기반에서 직접 분석 및 처리할 수 있는 메커니즘이 필요합니다.
- 지식 카탈로그 (컨텍스트 제공): 데이터 카탈로그를 발전시킨 제품입니다. Google Cloud 내부뿐만 아니라 타사 클라우드나 비정형 데이터의 정보도 일원적으로 관리합니다. AI에게 데이터뿐만 아니라 '그 데이터의 의미와 배경(컨텍스트)'을 주입함으로써, AI의 환각(거짓 정보를 그럴듯하게 만듦)을 방지할 수 있습니다. 이를 통해 저렴한 AI 모델이라도 고가 모델과 동등하거나 그 이상의 높은 정확도와 비용 효율성을 발휘할 수 있습니다.
- 데이터 에이전트 키트 (개발 자동화 및 효율화): 데이터 엔지니어를 위한 개발 지원 확장 기능(VS Code 등에서 사용 가능)입니다. 프롬프트로 지시만 내리면, AI가 데이터 마트 설계, 파이프라인(SQL 등) 코딩, 메타데이터 생성 등을 자율적으로 수행하여 개발 생산성을 극적으로(약 10배) 향상시킵니다.
이상적인 데이터 기반 'SOAP 아키텍처'
이 세 가지 제품을 조합한 'SOAP (Semantic and Ontology Agent Platform) 아키텍처'가 제안되었습니다. 데이터를 이동시키지 않고 연결하고(경계 없는 레이크하우스), 데이터의 의미나 업무 규칙(문서 정보 등)을 부여하며(지식 카탈로그), AI 에이전트에게 제공하는 구성입니다.
Knowledge Catalog
Google Cloud (GCP)의 Knowledge Catalog(구 Dataplex)와 2026년 10월에 일반 제공(GA)이 시작된 Data Agent Kit을 연동함으로써, AI 코딩 에이전트가 자율적으로 사내 데이터 구조를 이해하고 데이터 분석 및 파이프라인 구축을 수행할 수 있게 됩니다.
이는 GCP 상의 다양한 데이터(BigQuery, AlloyDB, Cloud Storage 등)의 메타데이터, 데이터 리니지(data lineage), 데이터 품질 등을 일원 관리하는 '컨텍스트 엔진'입니다.
주요 기능

- AI에 대한 컨텍스트(배경 지식) 자동 제공
일반적인 AI 에이전트는 '어떤 테이블이 존재하는지', '어떻게 파티션 분할되어 있는지'와 같은 개발 환경의 컨텍스트를 가지고 있지 않습니다. Data Agent Kit을 통해 에이전트가 Knowledge Catalog에 접근함으로써, 개발자가 스키마나 오류 로그를 채팅창에 수동으로 붙여넣을 필요 없이, 에이전트 스스로 정확한 데이터 구조를 파악하여 SQL이나 Python 코드를 생성합니다. - 자연어 기반의 데이터 탐색
개발자는 에이전트에게 '베스트셀러 상품의 다음 달 수요를 예측해 줘'와 같이 자연어로 지시할 수 있습니다. 에이전트는 백그라운드에서 Knowledge Catalog를 자동으로 검색하여, 팀이 신뢰하는 판매 테이블이나 재고 테이블을 식별해 줍니다. - 모범 사례 기반의 안전한 쿼리 실행
Data Agent Kit에는 Google 데이터 엔지니어가 만든 오픈소스 '스킬(skill)'이 내장되어 있습니다. 이를 통해 에이전트는 BigQuery에서 쿼리를 실행하기 전에, 잘못된 전체 테이블 스캔(고액의 과금이 발생하는 작업)을 피하기 위해 파티션 키를 확인하는 등 비용 효율적인 안전한 모범 사례를 따르게 됩니다. - 거버넌스 및 보안 유지
에이전트는 사용자 본인(또는 사용자가 권한을 빌리는 서비스 계정)의 권한으로 각 데이터 소스 및 Knowledge Catalog에 연결합니다. 따라서 IAM(Identity and Access Management)에 의한 접근 제어와 행 수준/열 수준의 보안 정책이 자동으로 적용되어, 사내 거버넌스를 유지하면서 안전하게 데이터를 다룰 수 있습니다.
소매업을 샘플로 한 데이터 샘플 실습
팩트 테이블 1개, 디멘션 테이블 2개
매출 팩트 테이블 (Sales Fact Table)
| transaction_id | date | customer_id | product_id | quantity | total_amount |
|---|---|---|---|---|---|
| T1001 | 2026-10-01 | C001 | P101 | 2 | 3000 |
| ... |
고객 디멘션 테이블 (Customer Dimension Table)
| customer_id | customer_name | age | gender | region | membership_rank |
|---|---|---|---|---|---|
| C001 | 田中太郎 | 34 | M | Tokyo | Gold |
| ... |
상품 디멘션 테이블 (Product Dimension Table)
| product_id | product_name | category | unit_price |
|---|---|---|---|
| P101 | ワイヤレスマウス | PC 주변기기 | 1500 |
| ... |
실행
Data Agent Kit(또는 Gemini in BigQuery와 같은 생성 AI 에이전트)를 사용하여, 제공된 CSV 데이터로부터 '고객 등급별 카테고리 매출'을 집계하는 데이터 마트를 구축하는 절차와 에이전트에 입력할 프롬프트 예시를 안내해 드립니다.
-
CSV 데이터를 데이터베이스에 로드하기: 사전 준비 단계입니다. 먼저, BigQuery와 같은 데이터 웨어하우스에 3개의 CSV 파일(sales_fact.csv, customer_dim.csv, product_dim.csv)을 업로드하고 각각 테이블로 생성합니다.
-
Data Agent에 프롬프트 입력하기: Data Agent Kit의 채팅 인터페이스(또는 AI 어시스턴트의 입력란)에 테이블 구조와 집계 요구사항을 명확하게 전달합니다. 아래 프롬프트를 복사하여 사용해 주세요.
-
생성된 SQL 확인 및 실행하기: 에이전트가 생성한 SQL 내용(JOIN 조건이나 GROUP BY 지정의 정확성)을 확인하고, 실행하여 데이터 마트(새로운 테이블 또는 뷰)를 만듭니다.
실제 입력 프롬프트 예시: AI 에이전트가 정확한 SQL을 생성할 수 있도록, 테이블 구조와 만들고 싶은 데이터 마트의 요구사항을 세트로 묶어 지시합니다.
prompt
以下の3つのテーブルを用いて、「顧客ランク別のカテゴリ別売上」を集計するデータマートを作成するBigQueryの標準SQLを生成してください。
【テーブル定義】
...
에이전트가 생성하는 SQL 이미지
CREATE TABLE `your_project.your_dataset.mart_customer_rank_category_sales` AS
SELECT
c.membership_rank,
...
실행을 통한 이미지 샘플

요약
Data Agent Kit은 BigQuery나 Cloud SQL 같은 데이터 리소스에 대해 자연어 지시만으로 데이터 탐색부터 파이프라인 구축까지 자동화할 수 있는 혁신적인 도구입니다.
AI 에이전트를 비즈니스 현장에서 똑똑하게 작동시키기 위해서는 '업무의 컨텍스트(문맥)'을 올바르게 AI에 제공하는 차세대 데이터 기반 구축이 필수적입니다.
토론

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기