Gemini 3.5 Transcribe 입문: 화자까지 파악 가능한 회의록 작성이 가능해지다
요약
Gemini 3.5 Transcribe는 화자 분리, 커스텀 어휘 등록 등 전문 기능을 갖춘 전용 음성 인식 모델입니다. 녹음 파일과 실시간 스트림 모두 지원하며, 사용 목적에 따라 원본을 충실히 기록하는 VERBATIM 모드와 읽기 쉽게 정형화하는 SMART 모드를 제공합니다.
핵심 포인트
- 전용 모델로 화자 분리 및 전문 기능 강화
- 녹음 파일(gemini-3.5-transcribe)과 실시간 스트림 모두 지원
- VERBATIM은 원본 기록에, SMART는 요약 초안 작성에 적합
- 발언 되풀이 자동 수정 등 정교한 전사 기능을 제공
서론
회의록을 작성하고 싶다고 가정해 봅시다.
지금까지는 Gemini 3.8 Flash와 같은 범용 모델에 음성 파일을 전달하면 전사(文字起こし) 및 회의록 작성이 어느 정도 가능했지만, 화자를 특정할 수 없어 누가 발언했는지 알 수 없다는 점에서 회의록으로는 치명적인 결점이 있었습니다.
2026년 8월에 등장한 Gemini 3.5 Transcribe는 바로 이 과제를 해결하기 위한 전용 전사 모델입니다.
화자 분리가 가능하며, 전문 용어 등록(커스텀 어휘)나 단어별 타임스탬프 등의 기능도 갖추고 있습니다.
이 글에서는 Gemini 3.5 Transcribe 모델에 대한 설명과 사용 방법을 안내해 드립니다.
Gemini 3.5 Transcribe란 무엇인가
Gemini 3.5 Transcribe는 Gemini의 고도화된 음성 이해 능력을 기반으로 개발된 음성 인식 모델입니다. 녹음 파일용과 실시간용 두 가지가 제공됩니다.
| 모델 ID | 용도 | 입력 |
|---|---|---|
gemini-3.5-transcribe | 녹음된 파일을 모아서 전사하기 | 음성 파일 |
gemini-3.5-transcribe-live | 마이크 등의 음성을 실시간으로 전사하기 | 16kHz의 음성 스트림 |
주요 기능은 다음과 같습니다.
| 기능 | 내용 | 파일용 | Live용 |
|---|---|---|---|
| 언어 자동 판별 | 85개 이상의 언어를 판별하며, 문 도중에 언어가 바뀌어도 추적합니다 | 가능 | 가능 |
| ... | |||
| 숫자나 단위의 표기도 자동으로 정형화(정규화)됩니다. 실제 측정 결과에서는 '三件'이 '3건'으로, '十人'이 '10명'으로 자동 변환되었습니다. |
일본어도 공식 대응 언어에 포함되어 있습니다. Vertex AI 문서에 기재된 언어별 성숙도 상태에서도 일본어는 'Supported'(많은 언어는 'Experimental')로 되어 있습니다.
참고로, GA(일반 제공) 시기는 플랫폼마다 다릅니다. Gemini API에서는 2026-08-26에 GA가 되며, Vertex AI에서는 2026-08에 프리뷰 버전, 2026-10에 GA 버전이 출시될 예정입니다.
두 가지 출력 모드 (VERBATIM과 SMART)
Gemini 3.5 Transcribe에는 용도에 맞는 두 가지 출력 모드가 준비되어 있습니다.
| 모드 | 특징 | 적합한 용도 | 사용 가능한 기능 |
|---|---|---|---|
| VERBATIM (기본값) | 말한 내용을 있는 그대로 충실하게 전사합니다 | 회의의 정확한 기록, 발언 분석, 자막 작성 | 화자 분리, 단어 타임스탬프 |
| SMART | 말더듬이나 되풀이를 제거하고 읽기 쉽게 정형화합니다 | 빠르게 읽고 싶은 회의록, 요약 초안 작성 | 자동 문단 나누기, 목록화 |
공식 문서에 게재된 출력 예시 비교는 다음과 같습니다.
| 발언 내용 | VERBATIM | SMART |
|---|---|---|
| えっと、会議にはアリスを招待するべきだと思います。あ、いや、ボブとキャロルを招待するべきです。 | えっと、会議にはアリスを招待して、いや、ボブとキャロルを招待しましょう。 | 会議には Bob と Carol を招待した方がいいと思います। |
| First item review budget second item finalize timeline third item send recap | first item review budget second item finalize timeline third item send recap | 1. 予算を確認します。 2. タイムラインを確定する 3. ダイジェストを送信 |
'아리스가 아니라 Bob'과 같은 발언의 되풀이도 문맥을 판단하여 최종 내용만으로 자동 수정됩니다.
후술하겠지만, VERBATIM 모드에서는 화자 분리나 단어 타임스탬프를 이용할 수 있지만, SMART 모드에서는 이들과 병용할 수 없다는 사양상의 차이가 있습니다.
처리 흐름의 전체 개요
음성을 전달하고 결과를 받는 API의 처리 플로우는 다음과 같습니다.
Transcribe는 음성을 받은 후 언어 판별 및 커스텀 어휘를 적용한 뒤, 지정된 모드(화자/시간 포함 또는 읽기 쉽게 정형화된 텍스트)로 결과를 반환합니다.
실시간으로 전사하고 싶을 경우 (Live API)
녹음 파일이 아닌, '마이크의 음성을 그 자리에서 실시간으로 텍스트로 변환하고 싶다', '방송 자막을 즉시 생성하고 싶다'와 같은 경우에는 스트리밍 전용 모델인 gemini-3.5-transcribe-live를 사용합니다. ※본 절의 내용은 두 API의 공식 문서를 기반으로 합니다.
대화하는 일반적인 Live 에이전트와 달리, 모델로부터 응답 음성 등이 없고 순수한 텍스트로만 전사 결과를 스트리밍 방식으로 수신합니다.
주요 특징 및 사양
-
음성 입력: 16kHz 모노럴 PCM 음성을 청크(약 100밀리초 단위)로 실시간 스트리밍 전송합니다. -
2가지 종류의 전사 텍스트: -
interim_input_transcription: 말하는 도중의 중간 경과 (즉시 도착하지만 나중에 수정될 수 있음. 화면 자막용) -
input_transcription: 발화가 끝났을 때 확정된 버전 (회의록 저장용) -
사용 시 주의사항:
-
1 세션의 최대 길이는 10분입니다(장시간 회의 등의 경우 주기적인 재연결 제어 필요).
-
**화자 분리(누가 말했는지)**는 지원하지 않습니다.
-
SMART 모드(필러 제거)에도 비지원합니다.
-
1 세션의 최대 길이는
범용 모델・Transcribe・Live 사용 구분
지금까지 살펴본 것처럼, Gemini로 음성을 전사하려면 '범용 모델', 'Transcribe(파일용)', 'Transcribe Live(실시간용)'의 세 가지 선택지가 있습니다.
| 항목 | 범용 모델에 음성을 전달할 때 | Gemini 3.5 Transcribe (파일용) | Gemini 3.5 Transcribe Live (실시간) |
|---|---|---|---|
| 적합한 용도 | 음성 요약・질문 응답 | 녹음 파일의 전사 | |
| 실시간 자막, 음성 입력 | |||
| 한 번에 처리 가능한 길이 | 9.5시간 | Gemini API: 최대 1시간 / Vertex AI: 15분 | 1 세션 10분 |
| 화자 분리 | 프롬프트로 요청 | 전용 파라미터(최대 8명) | 없음 |
| 단어별 시간 |
1. Google AI Studio (Gemini API)
개인 개발이나 가장 빠르게 프로토타입을 만들고 싶다면, Google AI Studio에서 API 키를 발급받아 사용하는 것이 간편합니다.
Google AI Studio에서 API 키를 얻어 환경 변수 GEMINI_API_KEY에 설정하면 Python SDK에서 바로 호출할 수 있습니다. 공식 가이드에서는 몇 초가 넘는 파일의 경우 Files API 사용을 권장하고 있습니다.
from google import genai
client = genai.Client()
# 음성 파일을 업로드하여 전사(transcribe)하기
...
※이 코드는 Gemini API 공식 가이드에서 인용한 것입니다.
2. Google Cloud Vertex AI
회사 내부의 기밀 음성이나 상업 데이터를 다루거나, Cloud Storage (GCS)와 직접 연동하고 싶다면 **Google Cloud Vertex AI (Gemini Enterprise Agent Platform)**를 이용합니다.
Google Cloud 콘솔상의 'Vertex AI' > 'Model Garden' 등에서 모델 사양을 확인할 수 있습니다. 시스템에 통합할 때는 Cloud Storage 상의 음성 파일(gs://...)을 직접 지정하여 호출하는 것이 일반적입니다.
from google import genai
from google.genai import types
# Vertex AI 클라이언트 초기화 (gcloud auth application-default login으로 인증)
...
실측 결과, 약 255초(4분 15초)의 음성에 대해 단 5.0초 만에 결과가 반환되었습니다.
주요 기능 지정 방법 (플랫폼별 작성 방식 차이)
코드에서 호출할 때 Google AI Studio (Gemini API)와 Vertex AI에서는 설정하는 위치가 다릅니다. 대응 관계는 아래 표와 같습니다.
| 기능 | Google AI Studio (Gemini API) | Vertex AI (Google Cloud) | 비고 |
|---|---|---|---|
| 언어 명시 | `language_codes: [ |
- Gemini 3.5 Transcribe에서 화자 분리(
diarization=True)를 지정하여, 화자 레이블이 포함된 텍스트를 가져옵니다. - 이렇게 얻은 텍스트를 Gemini 3.8 Flash에 전달하며, 프롬프트로 '화자 레이블을 유지한 채 말더듬(言いよどみ)만 제거해 달라'고 지시합니다.
Transcribe는 음성 인식 전용 모델이기 때문에 텍스트를 입력하여 다듬을 수는 없지만, Gemini 3.8 Flash를 이용한 텍스트 처리는 매우 빠르고 저렴하기 때문에 이 두 단계로 구성하는 방식이 가장 실용적입니다.
요금 (料金)
Gemini API와 Vertex AI는 동일한 단가를 적용합니다(2026년 10월 기준).
| 모델 | 입력 (음성) | 출력 (텍스트) | 1분당 예상 비용 |
|---|---|---|---|
gemini-3.5-transcribe | $2.00/100만 토큰 | $12.00/100만 토큰 | 약 $0.005 |
gemini-3.5-transcribe-live | $3.50/100만 토큰 | $21.00/100만 토큰 | 약 $0.009 |
음성은 1초당 25토큰으로 환산됩니다. 실제 측정에서도 254.7초 분량의 음성 입력이 6,367토큰이었습니다. 출력은 1분당 약 173토큰으로, Gemini API 요금 페이지의 예상치(175토큰/분)와 거의 일치합니다.
1시간 회의를 기준으로 할 경우, 입력 9만 토큰에 약 $0.18, 출력 1만 토큰에 약 $0.13이며, 총합은 약 $0.31입니다(추정).
요약 (まとめ)
Gemini 3.5 Transcribe는 화자 분리・단어 타임스탬프・사용자 정의 어휘・SMART 등 전용 파라미터 지정이 가능한, 녹취록 전용 모델입니다.
이를 조합하여 회의록 앱을 만들면, 화자를 특정하면서 마치 사람이 작성한 것 같은 회의록을 만들 수 있게 될 것입니다.
토론 (Discussion)

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기