Gemini 3.5 Live Translate를 활용한 유창하고 자연스러운 음성 번역
요약
Google이 최신 오디오 모델인 Gemini 3.5 Live Translate를 출시하여 실시간 음성-음성 번역 기능을 제공합니다. 이 모델은 70개 이상의 언어를 지원하며, 화자의 억양과 속도를 유지하는 자연스러운 음성을 생성합니다. 개발자들은 Gemini Live API를 통해 이를 활용해 다양한 앱을 구축할 수 있습니다.
핵심 포인트
- 70개 이상 언어 자동 감지 및 실시간 번역 지원
- 화자의 억양, 속도 등을 유지하는 자연스러운 오디오 생성
- Gemini Live API로 개발자 접근성 강화 (Google AI Studio)
- Google Meet 및 Google Translate 등 다양한 제품에 순차적 출시
Gemini 3.5 Live Translate를 활용한 유창하고 자연스러운 음성 번역

20년 전, Google의 번역은 언어 과학을 인간적인 연결의 마법으로 바꾸기 위한 선구적인 머신러닝 실험 중 하나로 시작되었습니다. 그 실험은 오늘날까지 발전하여 매달 수조 단어가 우리의 다양한 제품에서 수십억 명의 사용자들을 위해 번역되고 있습니다.
오늘, 우리는 최신 오디오 모델인 Gemini 3.5 Live Translate를 출시하며 다음 단계로 나아갑니다. 이는 실시간 음성-음성 번역을 위한 것입니다.
이 모델은 70개 이상의 언어를 자동으로 감지하고, 화자의 억양(intonation), 속도(pacing), 피치(pitch)를 유지하는 부드럽고 자연스러운 번역 음성을 생성합니다. 발화자가 말을 마칠 때까지 기다렸다가 응답하는 방식의 시스템과 달리, 3.5 Live Translate는 연속적으로 음성을 생성하여, 품질 향상을 위해 문맥을 기다리는 것과 화자와 동기화되도록 즉시 번역하는 것 사이의 상충 관계를 균형 있게 맞춥니다. 이 모델은 어색한 멈춤 없이 유창한 오디오를 제공하며, 세션 내내 화자보다 단 몇 초 정도만 뒤처집니다.
Gemini 3.5 Live Translate는 오늘부터 Google 제품 전반에 걸쳐 순차적으로 출시됩니다:
- Gemini Live API 및 Google AI Studio를 통한 개발자 대상 공개 미리보기(public preview)
- 이번 달부터 Google Meet에서 기업 고객 대상 비공개 미리보기(private preview)
- Android 및 iOS의 Google Translate를 통해 모든 사용자 대상
Gemini Live API가 작동하는 모습을 확인하고 더빙(dubbing) 및 동시 다국어 번역 기능을 활용해 보세요. Gemini Cookbook에서 데모 또는 추가 예제 코드를 살펴보세요.
Gemini Live API를 사용함으로써 Agora, Fishjam, LiveKit, Pipecat, Vision Agents와 같은 개발자 플랫폼은 개발자가 쉽게 음성 번역 앱을 구축하고 배포할 수 있도록 지원합니다. 이러한 통합 기능들은 복잡한 실시간 미디어 스트리밍 인프라를 처리하므로, 개발자는 사용자 경험에만 집중할 수 있습니다.
Grab의 파트너들은 이 모델을 테스트하여 픽업 시 운전자와 여행자 간에 거의 실시간으로 다국어 통신이 가능하도록 하고 있습니다. 이 사용자들은 Grab을 통해 매월 1,000만 건 이상의 음성 통화를 합니다.
초기 리뷰 읽기
Grab 외에도 CJ ENM, LiveKit 등 여러 회사들이 3.5 Live Translate에 대해 인상적인 번역 품질, 정확도 및 낮은 지연 시간(low latency)을 강조하며 긍정적인 피드백을 공유했습니다.
비디오 회의에서 3.5 Live Translate 경험하기
Google Meet의 음성 번역 기능은 곧 3.5 Live Translate를 사용하게 되며, 다음 기능을 통해 사용자 경험을 개선할 예정입니다:
- 이전 제한이었던 단 5개 언어에서 70개 이상의 언어를 제공,
- 이전에는 영어로만 번역하는 상태였던 것에서 벗어나, 한 회의에서 2,000개 이상의 언어 조합에 걸친 대화가 가능하게 함,
- 음성 번역에 즉시 접근할 수 있도록 인터페이스를 업데이트.
저희는 이번 달부터 일부 비즈니스 Google Workspace 고객을 대상으로 비공개 미리보기(private preview)로 이 업데이트를 시작하며, 연말쯤 더 광범위하게 배포할 예정입니다.
Android 또는 iOS의 Google Translate 앱에서 3.5 Live Translate 받기
이 모델은 또한 Android와 iOS 모두에서 Google Translate 앱을 통해 전 세계적으로 출시되고 있습니다. 라이브 번역(Live translate) 기능을 사용할 때는, 헤드폰 한 쌍만 연결하면 화자의 톤을 반영하는 더욱 원활한 번역을 70개 이상의 언어에서 경험할 수 있습니다.
Android 사용자를 위해 3.5 Live Translate를 활용한 새로운 ‘듣기 모드(listening mode)’도 출시하기 시작했습니다. 이 기능을 사용하면 휴대폰 이어피스에서 직접 번역된 내용을 들을 수 있습니다. 일반 통화처럼 휴대폰을 귀에 대기만 하면, 번역된 음성이 사용자에게 곧바로 스트리밍됩니다. 이 새로운 경험은 다른 사람들이 듣지 못하게 빠르게 번역 내용을 들어야 하거나 헤드폰이 준비되지 않은 상황에서 유용할 수 있습니다.
새로운 듣기 모드를 사용하면, 스페인어로 진행되는 가이드 투어의 영어 번역을 휴대폰 이어피스를 통해 거의 실시간으로 들을 수 있습니다.
SynthID 워터마크 적용
저희 모델이 생성하는 모든 오디오에는 SynthID로 워터마크가 적용됩니다. 이 인지할 수 없는(imperceptible) 워터마크는 오디오 출력에 직접 짜여져, AI가 생성한 콘텐츠가 감지될 수 있도록 하여 잘못된 정보(misinformation) 확산을 방지하는 데 도움을 줍니다. 안전 및 책임에 대한 저희의 접근 방식에 대한 자세한 내용은 모델 카드를 검토해 주십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Google DeepMind의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기