Gemini 증류 서비스(Distillation Service) 얼리 액세스 제공
요약
Google이 Gemini Enterprise Agent Platform에 대형 모델의 추론을 활용해 소형 모델을 학습시키는 증류(Distillation) 기능을 추가했습니다. 수동 레이블링 없이 Gemini 3.1 Pro를 교사 모델로 사용하여 Gemini 2.5 Flash를 미세 조정할 수 있는 파이프라인을 제공합니다.
핵심 포인트
- 수동 데이터 레이블링 없이 교사 모델의 추론 출력을 활용한 학습 가능
- Gemini 3.1 Pro의 성능을 Gemini 2.5 Flash로 전이하여 비용 및 지연 시간 최적화
- 데이터셋 수집부터 엔드포인트 생성까지 5단계 자동화 파이프라인 제공
- 현재 텍스트 전용이며 us-central1 지역 및 화이트리스트 기반 얼리 액세스로 제한
Google이 Gemini Enterprise Agent Platform에 증류(distillation) 기능을 추가했습니다. 이 기능은 수동 데이터 레이블링(manual data labeling) 과정 없이, 더 큰 모델의 추론(reasoning) 출력을 사용하여 더 작은 모델을 학습할 수 있게 해줍니다.
Teacher Model: Gemini 3.1 Pro
Student Model: Gemini 2.5 Flash
Inputs: 프롬프트만 입력 (정답이 없는 질문)
Outputs: 미세 조정(fine-tuned)된 학생 모델, 10개의 중간 평가 체크포인트, 자동 프로비저닝된 엔드포인트(endpoints)
파이프라인은 데이터셋 수집(dataset ingestion), 교사 모델 추론(teacher inference), 학생 모델 증류 학습(student distillation training), 체크포인트 등록(checkpoint registration), 엔드포인트 생성(endpoint generation)의 5단계로 실행됩니다.
제한 사항 및 한계
최대 데이터셋 크기: 50,000개의 프롬프트 예시, 1GB JSONL 파일로 제한
입력 토큰 상한: 프롬프트 예시당 8,000 토큰. 데이터셋 항목의 10%를 초과하여 이 제한을 넘을 경우 작업 실패
교사 모델 출력 상한: 응답당 24,000 토큰. 더 긴 추론 트레이스(reasoning traces)는 조용히 잘리며(truncated), 이는 학습 데이터 품질을 저하시킴
모달리티(Modality): 텍스트 전용. 이미지, 비디오, 오디오 또는 함수 호출(function calling) 지원 안 함
지역 가용성: us-central1로 엄격히 제한됨
필요 권한: Full roles/aiplatform.admin IAM 액세스
액세스 요구 사항: 화이트리스트(Whitelist) 전용. cloud-ai-tuning-service-support@google.com으로 이메일 요청 시 30일 단위로 부여됨
기본 동시성 할당량(Concurrency Quota): 4개의 동시 증류 작업
권장 학습 파라미터
최소 권장 데이터셋: 눈에 띄는 추론 성능 향상을 확인하려면 1,000개 이상의 프롬프트 예시 필요
기본 하이퍼파라미터(Hyperparameters): epochCount 4로 설정, learningRateMultiplier 1로 설정, candidateCount 4로 설정
조정 가능 범위: Epochs 1100 사이, learning rate multiplier 0.254.0 사이, candidate count 1~5 사이
주요 사용 사례
- 실제 운영 환경의 프롬프트 양은 방대하지만 레이블링된 정답(ground-truth answers)이 전혀 없는 경우
- Gemini 2.5 Flash의 지연 시간(latency)과 비용으로 Gemini 3.1 Pro 수준의 다단계 추론(multi-step reasoning) 성능을 원하는 경우
- 빠른 평가 스윕(evaluation sweeps)이 필요한 경우
사전 구축된 엔드포인트(endpoints)를 갖춘 10개의 중간 모델 체크포인트(checkpoints) 자동 생성 기능은 비교 평가를 간소화합니다.
현재의 제한 사항 및 버그
운영 상태: 명시적으로 얼리 액세스(early access)로 분류되어 있으며, 이는 운영 SLA(Service Level Agreements)를 보장하지 않음을 의미합니다.
파이프라인 결합(Pipeline Coupling): 교사 모델 추론(Teacher inference)과 학생 모델 튜닝(student tuning)이 단일 호출로 결합되어 있습니다. 생성된 교사 모델의 추론 데이터셋을 향후 실행을 위해 내보내거나 재사용할 수 없습니다.
컴플라이언스 제약: CMEK(Customer-Managed Encryption Keys, 고객 관리 암호화 키) 지원이 부족하여, 엄격한 컴플라이언스 환경에서의 배포가 불가능합니다.
콘솔 UI 결함: 준비(prepare) 단계에 진행 표시기(progress indicators)가 없으며, 체크포인트 테이블의 에포크(epoch) 컬럼이 현재 모든 항목에 대해 0으로 표시되는 기본값을 가집니다.
멀티 턴(Multi-Turn) 제약: 멀티 턴 프롬프트 데이터셋이 기술적으로는 수용되지만, 멀티 턴 추론 트레이스(reasoning traces)에 대한 품질 검사는 현재 검증되지 않은 상태입니다.
도구 통합: REST API 호출 및 curl을 통해서만 엄격하게 작동하며, 아직 네이티브 SDK 지원은 제공되지 않습니다.
submitted by /u/UsedMorning9886 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기