Gemini 3.5 Transcribe를 활용한 지능형 전사(Transcription)
요약
Gemini 3.5 Transcribe는 배경 소음, 전문 용어 처리 등 기존 모델의 한계를 극복한 지능형 음성 전사 모델입니다. 개발자들은 Gemini API와 Agent Platform을 통해 이 기능을 활용하여 실시간 스트리밍 및 녹음 오디오 처리를 구현할 수 있습니다.
핵심 포인트
- 지능형 전사로 배경 소음, 전문 용어 처리 능력이 향상됨.
- 실시간 스트리밍(gemini-3.5-transcribe-live)과 녹음 오디오 처리 API를 제공함.
- 화자 할당 및 단어별 타임스탬프 등 고급 기능을 지원함.
- Gboard, Antigravity 등 다양한 Google 제품에 통합되어 사용자 경험을 개선함.
Gemini 3.5 Transcribe를 활용한 지능형 전사

오늘 저희는 가장 정교한 음성-텍스트 변환 모델인 Gemini 3.5 Transcribe를 소개합니다. 이 모델은 지능형 음성 상호작용을 위해 설계되었습니다. 배경 소음, 복잡한 전문 용어(jargon), 말더듬 정리 등에 어려움을 겪는 기존의 음성 인식 모델과 달리, Gemini 3.5 Transcribe는 원본 오디오를 정확하고 다듬어진 형식의 텍스트로 직접 변환합니다.
Gemini 앱이나 Android와 같은 저희 제품 전반에 걸쳐, 소비자들은 이미 Rambler(Android) 및 macOS용 Gemini 앱에서와 같이 새로운 음성 기능을 통해 이 전사 모델의 혜택을 누리고 있습니다. 이제 개발자들은 Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform에서 Gemini 3.5 Transcribe를 사용하여 유사한 기능을 구축할 수 있습니다.
저희는 3.5 Transcribe가 음성 에이전트, 실시간 자막 도구 또는 통화 후 분석 파이프라인 등 개발자 워크플로우에 원활하게 통합되도록 구축했습니다. 이 모델은 두 개의 별도 API를 통해 사용할 수 있습니다:
실시간 스트리밍(Real-time streaming): gemini-3.5-transcribe-live를 사용하여 인터랙티브 음성 앱을 위한 연속적이고 양방향의 스트리밍과 서브초 지연 시간(sub-second latency)을 제공합니다.
**.**녹음 오디오 처리(Pre-recorded audio processing): gemini-3.5-transcribe를 사용하여 녹음된 오디오, 회의, 통화 기록 등을 화자 할당(speaker attribution) 및 단어별 타임스탬프(word-level timestamps)와 함께 전사합니다.
.
더욱 정교하고 지능적인 전사를 얻으세요
Gemini 3.5 Transcribe는 사용자의 자연스러운 말하는 방식을 포착하여 의도를 더 잘 이해하고 사용자 지정 어휘(custom vocabulary)를 인식하도록 설계되었으며, 이를 통해 음성으로 작업을 실행할 수 있습니다.
스마트 전사(Smart transcription): 자기 수정(
스마트 전사 및 고급 받아쓰기 경험
Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform 외에도, 3.5 Transcribe는 표준 음성-텍스트 변환(speech-to-text)을 넘어 Google 전반에서 작업하는 느낌을 더욱 자연스럽고 직관적으로 만듭니다. Gboard, Antigravity, Gemini 앱, Chrome과 같은 일상적인 인터페이스에 문맥 인식 이해(context-aware understanding)를 직접 가져와 미묘한 뉘앙스, 의도, 인라인 편집까지 쉽게 포착합니다.
- Android의 Gboard에서는 새로운 Rambler 기능을 통해 3.5 Transcribe가 말로 된 생각을 잘 정리된 텍스트로 변환하고, 필러 단어(filler words)를 걸러냅니다. 또한 음성을 사용하여 편집하거나, 오타를 수정하거나, 작성 스타일을 변경할 수도 있습니다.
- Google Antigravity에서는 사용자의 허가를 받아 화면의 문맥과 채팅 기록을 결합하여 파일 이름, 에이전트 생각, 활성 문서 전반에 걸쳐 정확한 전사를 보장합니다.
- Google AI Studio에서는 Build 모드에서 3.5 Transcribe에 접근하여 말로 앱 코드를 즉석에서 작성(vibe code)할 수 있습니다.
- macOS의 Gemini 앱에서는 3.5 Transcribe가 사용자의 자연스러운 음성을 깨끗하게 형식화된 텍스트로 전사할 뿐만 아니라, 화면 문맥과 원활하게 결합하여 복잡한 워크플로우를 구동하는 음성 명령도 가능하게 합니다. 백그라운드에서 다른 Gemini 모델을 호출하여 무거운 작업을 처리함으로써, 사용자는 오직 목소리만을 사용하여 로컬 파일 요약, 앱 간 텍스트 재사용, 또는 커서 위치에서 이미지 생성 등을 손쉽게 수행할 수 있습니다.
- Chrome에서는 곧 모든 웹 필드에 말로 타이핑할 수 있게 되어, 음성으로 답장 작성, 게시물 초안 작성, 또는 Chrome에서 Gemini 프롬프트를 더 자연스럽고 쉽게 입력할 수 있습니다.
Gemini 3.5 Transcribe를 사용하면 macOS의 Gemini 앱에서 오직 목소리만을 사용하여 파일 분석, 이미지 생성 및 검색을 할 수 있습니다.
Android에서 Rambler가 필러 단어를 자동으로 제거하고 음성을 정리하는 방식을 보여주는 내용을 확인해 보세요.
Gemini 3.5 Transcribe는 Google Antigravity의 화면 컨텍스트를 활용하여 정확한 전사(Transcription) 정확도를 보장합니다.
초기 리뷰 확인하기
개발자 플랫폼인 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 등은 Gemini Live API를 활용하여 개발자들이 고성능의 음성 기반 인터페이스를 쉽게 구축하고 배포할 수 있도록 지원합니다. 이들 플랫폼은 복잡한 실시간 미디어 스트리밍 인프라를 백그라운드에서 관리하므로, 개발자는 사용자 경험을 만드는 데 전적으로 집중할 수 있습니다.
vivo, Intellitek Health, Lingopal과 같은 기업들도 3.5 Transcribe에 대해 긍정적인 피드백을 공유하며, 이의 인상적인 지연 시간(latency), 정확도, 그리고 광범위한 언어 지원 기능을 강조했습니다.






오늘 3.5 Transcribe 사용 시작하기
개발자를 위해: Google AI Studio 및 Google Antigravity를 통해 Gemini API에서 공개 미리보기로 제공됩니다.기업을 위해: Gemini Enterprise Agent Platform을 통해 공개 미리보기로 제공되며, 곧 Gemini Enterprise for Customer Experience에서도 이용 가능합니다.모두를 위해: macOS의 Gemini 앱(영어), 특정 국가 및 언어의 Android용 Rambler에서 사용 가능하며, 곧 Chrome에서도 이용 가능할 예정입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Google DeepMind의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기