BigQuery AI 함수 정확도 검증 프레임워크 구축하기
요약
본 글은 BigQuery의 AI 함수(AI.CLASSIFY 등)를 운영 환경에 적용하기 전, 그 정확도를 정량적으로 검증하는 시스템 구축 방법을 제시합니다. 골드 세트 설계부터 SQL 테스트 구현까지 다루며, 모델 업데이트나 데이터 변화로 인한 성능 저하를 지속적으로 모니터링할 수 있습니다.
핵심 포인트
- 골드 세트는 전형적/경계 사례 등 다양한 데이터를 포함해야 합니다.
- 분류 태스크는 Precision과 Recall을 계산하여 정확도를 측정합니다.
- 생성 태스크는 규칙 기반 검증이나 AI-as-a-Judge 기법으로 품질을 평가할 수 있습니다.
- 정확도 평가 결과를 이력 테이블에 기록하고 주기적으로 모니터링해야 합니다.
이 글에서 해결할 과제
BigQuery의 AI 함수(AI.CLASSIFY, AI.GENERATE, AI.SCORE 등)를 운영 데이터에 적용하기 전에, 그 정확도를 정량적으로 확인할 수 있습니까?
'대충 작동한다'는 느낌으로 운영을 시작하면, 모델 업데이트나 입력 데이터 변화로 인해 정확도가 서서히 저하되어 잘못된 분석 결과가 의사결정에 사용될 수 있습니다. 본 글에서는 평가용 데이터셋 설계부터 SQL 단일 테스트 구현까지, AI 함수의 정확도를 지속적으로 검증하는 시스템 구축 방법을 설명합니다.
왜 정확도 검증이 필요한가?
AI 함수의 출력은 모델의 확률적 추론에 기반합니다. 동일한 프롬프트라도 미묘하게 결과가 달라질 수 있으며, 특히 다음 상황에서 정확도 저하가 발생하기 쉽습니다.
- 모델 버전 업데이트: Gemini 모델이 자동으로 업데이트되면서 출력 경향이 바뀜
- 입력 데이터 변화: 상품 설명의 포맷이나 표현이 바뀜
- 프롬프트 변경: 개선을 의도했음에도 일부 케이스에서 정확도가 떨어짐
정확도 검증 시스템이 없다면, 이러한 변화를 감지할 수 없습니다.
평가 데이터셋 설계
정확도 검증의 핵심은 정답 레이블(gold set)을 갖춘 골드 세트를 준비하는 것입니다.
골드 세트 요구사항
-- 평가용 골드 세트 테이블 정의 예시
CREATE TABLE `project.dataset.ai_evaluation_gold`
(
...
골드 세트에는 다음 3가지 종류의 데이터를 포함해야 합니다.
| 종류 | 내용 | 비율의 예상치 |
|---|---|---|
| 전형적 예시 (典型例) | 모델이 쉽게 정답을 맞힐 수 있는 케이스 | 50% |
| ... | ||
| 경계 사례(境界例)와 엣지 케이스를 의도적으로 포함함으로써, 프롬프트 수정 후의 퇴행을 감지하기 쉬워집니다. |
정답 레이블 지정 방법
-- 평가 데이터를 준비하는 쿼리 (수동 검토용 출력)
SELECT
product_id AS eval_id,
...
이 쿼리로 추출한 데이터를 스프레드시트에 작성하여 업무 담당자가 레이블을 지정한 후, 골드 세트 테이블에 가져옵니다. 최소 100~200건, 클래스가 여러 개일 경우 각 클래스당 30건 이상을 기준으로 하는 것이 좋습니다.
분류 정확도 측정
AI.CLASSIFY를 사용한 분류 태스크에서는 정확도(Precision)와 재현율(Recall)을 계산합니다.
-- AI.CLASSIFY의 출력을 골드 세트와 대조하여 정확도를 계산
WITH ai_results AS (
SELECT
...
전체 정답률 (Accuracy)
-- 간단한 전체 정답률 확인
SELECT
COUNT(*) AS total,
...
생성 태스크 품질 측정
AI.GENERATE와 같은 자유 형식의 생성 태스크는 레이블로 평가할 수 없습니다. 대신 다음 방법으로 품질을 정량화합니다.
규칙 기반 검증
-- 생성 결과가 규칙을 충족하는지 체크
WITH generated AS (
SELECT
...
AI-as-a-Judge를 통한 품질 평가
생성 품질을 AI 함수 자체로 평가하는 기법입니다.
-- AI 생성물의 품질을 AI로 평가하기 (AI-as-a-Judge)
SELECT
product_id,
...
이 방법은 절대적인 정확도 측정은 아니지만, 프롬프트 수정 전후 비교에 활용할 수 있습니다.
지속적인 정확도 모니터링 구현
골드 세트에 대한 정확도를 주기적으로 측정하여 테이블에 기록합니다.
-- 정확도 평가 결과를 이력 테이블에 기록
INSERT INTO `project.dataset.ai_accuracy_history`
SELECT
...
이 쿼리를 스케줄링 쿼리로 매주 실행하고, Looker Studio에서 시각화함으로써 모델 업데이트로 인한 퇴행을 조기에 감지할 수 있습니다.
정확도 알림 설정
-- 정확도가 임계값 이하일 때 감지하는 쿼리
SELECT
eval_date,
...
이 쿼리 결과를 Cloud Scheduler와 연동하여 Slack 알림을 보내는 시스템으로 구축하면, 정확도 저하를 놓치는 것을 방지할 수 있습니다.
평가 프레임워크의 전체 개요
구현 단계를 정리하면 다음과 같은 흐름이 됩니다.
- 골드셋(Gold Set) 구축: 샘플링 → 수동 라벨링 → 테이블 적재 -
베이스라인 측정: 최초의 정확도를 측정하여 기준값으로 기록 -
정기 평가: 스케줄 쿼리로 주간/월간 정확도 측정 -
알림 설정: 정확도가 임계값을 밑돌면 통지
프롬프트 개선 주기: 정확도 저하 원인을 분석하여 프롬프트 수정
특히 골드셋의 유지보수는 지속적으로 수행해야 합니다. 입력 데이터 분포가 변경된 경우에는, 새로운 데이터를 샘플링하여 골드셋을 확장해 주십시오.
요약
BigQuery의 AI 함수를 본 운영에 사용하기 위해서는, 정확도를 정량적으로 파악하는 메커니즘이 필수적입니다.
- 골드셋을 만들어 전형적인 예시(Typical Case), 경계 예시(Boundary Case), 엣지 케이스(Edge Case)를 포함합니다 -
- Precision/Recall/F1로 클래스별 정확도를 측정합니다 -
- 정확도 이력 테이블에 기록하여 추이를 감시합니다 -
- 알림으로 정확도 저하를 조기에 감지합니다
AI 함수는 모델의 확률적 출력에 의존합니다. 정확도 검증 메커니즘을 갖추어 둠으로써, 신뢰성 높은 AI 활용 기반을 구축할 수 있습니다.
데이터 기반 설계, AI 함수 활용 지원, BigQuery × GA4 분석에 대한 상담은, 꼭 아래에서 문의해 주십시오.
토론

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기