Gemini 3.8 Live와 3.8 Live Extended Thinking
요약
Google이 규모 확장 및 비용 효율에 초점을 맞춘 Gemini 3.8 Live와 고난도 작업 및 다단계 추론에 특화된 Gemini 3.8 Live Extended Thinking을 출시했습니다. 두 모델은 음성 대화 기반의 에이전트 기능을 제공하며, 준실시간 시각 입력과 자동 언어 감지 등 향상된 능력을 갖추고 있습니다.
핵심 포인트
- Gemini 3.8 Live는 비용 효율성과 규모 확장에 중점을 둔 모델입니다.
- Extended Thinking은 다단계 추론 및 복잡한 작업을 처리하며 대화 흐름을 유지합니다.
- 두 모델 모두 개발자가 프로덕션용 음성 에이전트를 구축하는 데 활용됩니다.
- 각 모델은 Speech to Speech Quality Index 등 여러 평가에서 높은 성능을 기록했습니다.
Google이 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시함. 각각 규모 확장과 비용 효율, 고난도 작업과 다단계 추론에 초점을 맞춘 음성 대화 모델임
Gemini 3.8 Live는 준실시간 시각 입력을 대화 맥락에 반영하고, 97개 지원 언어를 대화 중 자동 감지해 전환함
Extended Thinking은 추론과 발화를 동시에 수행함. 복잡한 작업을 처리하는 동안 짧은 응답으로 요청을 확인하고 진행 상황을 음성으로 전달해 대화 흐름을 유지함
Extended Thinking은 Artificial Analysis Speech to Speech Quality Index에서 82.6점으로 종합 1위를 기록함. Gemini 3.8 Live는 사용자 선호도를 평가하는 Speech Agent Arena에서 2위를 차지함
두 모델은 Gemini API와 Google AI Studio에서 출시일부터 순차 제공되며, 기업용은 비공개 프리뷰로 제공됨. 일반 사용자의 이용 범위는 모델과 서비스, 구독 등급에 따라 다름
모델별 설계와 대화 방식
Gemini 3.8 Live는 규모 확장과 비용 효율을 목표로 대화 지능, 매끄러운 대화 흐름, 시각 정보에 기반한 응답을 결합함
Gemini 3.8 Live Extended Thinking은 고난도 작업을 위한 모델로, 더 높은 지능과 다단계 추론을 제공함
두 모델은 개발자와 기업이 프로덕션용 음성 에이전트를 구축할 수 있도록 설계됐으며, Gemini 앱, Google Workspace, Search에서 음성으로 복잡한 작업을 수행하는 데 활용됨
Gemini 3.8 Live는 준실시간 시각 입력으로 대화 맥락을 보강하고, 대화 도중 97개 지원 언어를 자동 감지해 전환함
도구와 API 호출은 백그라운드에서 실행하므로, 작업이 완료되기 전에도 요청을 확인하고 대화를 계속할 수 있음
Extended Thinking은 추론과 발화를 동시에 수행하며 복잡한 작업 중에도 대화 흐름을 유지함
“확인해 볼게요” 같은 초기 음성 응답으로 요청을 자연스럽게 확인함
다단계 백그라운드 작업이 진행되는 동안 실시간 진행 상황을 음성으로 전달함
음성 대화와 작업 수행 평가
Extended Thinking은 음성 품질, 에이전트 작업 완료, 추론 평가에서 다음 성적을 기록함
Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 종합 1위를 차지함
에이전트 작업 완료 평가인 τ-Voice에서 68.6%, Sierra의 τ-Voice-banking에서 35.1% 를 기록하며 선두를 차지함
Big Bench Audio에서 97.7% 를 기록했으며, 다른 프런티어 모델 대비 경쟁력 있는 가격대를 유지함
Gemini 3.8 Live는 사용자 선호도 기반 Speech Agent Arena에서 2위를 기록했으며, 대규모 활용을 위한 비용 효율에 초점을 맞춤
ServiceNow의 음성 에이전트 평가인 EVA-Bench에서는 두 모델이 복잡한 워크플로의 정확도와 대화 품질 사이에서 파레토 프런티어를 확장함
해당 평가는 Gemini Enterprise Agent Platform의 Live API에서 실행됨
시연과 Google 서비스 활용
Gemini 3.8 Live 시연은 시각 맥락과 자연스러운 음성 대화를 활용하는 사례를 포함함
직원 온보딩 과정에서 시각 정보를 바탕으로 실시간 질문에 답함
시각 맥락과 추론을 활용해 준실시간으로 체스를 둠
자연스러운 음성 대화로 완성된 사업 계획과 맞춤형 마케팅 도구 모음을 만듦
Extended Thinking 시연은 다단계 작업과 비동기 실행에 초점을 맞춤
초기 스케치와 준실시간 음성 피드백을 실제로 작동하는 React 컴포넌트로 변환함
자연스러운 대화를 끊지 않고 다단계 예약과 비동기 함수 호출을 조율함
Google Workspace에서는 Docs Live, Gmail Live, Keep Live를 통해 Extended Thinking을 활용할 수 있음
Search Live에서는 Gemini 3.8 Live를 이용해 단계별 실시간 문제 해결 도움을 받을 수 있음
개발자 플랫폼과 기업 생태계
Gemini Live API를 활용하는 개발 플랫폼은 실시간 미디어 스트리밍 인프라를 처리해, 개발자가 음성 인터페이스의 사용자 경험에 집중하도록 지원함
모국어가 아프리칸스어인데, 남아프리카공화국 밖에서는 교사나 대화 상대를 찾기 어려운 언어임. 지금은 미국에 살고 있어 혼자 운전할 때 Gemini로 실시간 대화를 하거나 즉석 문법 수업을 받고 있음. 언어 구사력이 정말 뛰어나서 가족들도 듣고 깜짝 놀랄 정도임.
LLM과 AI를 쓰면서 가장 큰 즐거움을 얻는 용도인 듯함. 모국어를 다시 꾸준히 말할 수 있게 되어 정말 좋음. 이번 출시와 실시간 대화 개선이 기대되며, 다른 선도 AI 연구소들도 이런 소수 언어를 지원해 선택지가 늘어나길 바람.
Gemini의 글쓰기는 과소평가되어 있음. 그나마 읽을 만한 글을 만들어 내는 유일한 모델임.
번역과 현지화도 정확하게 해내는 유일한 모델임. 다른 선도 모델들은 근처에도 못 미침. 코딩 능력은 떨어지지만 자연어 처리는 최상급임.
묵직한 작업에는 Astra를 쓰지만, 궁금한 주제를 파고들거나 아이디어를 구상할 때는 Gemini와 대화하는 편이 훨씬 즐거움. 최고 성능을 따라잡으려다 지금의 자연스러운 말투를 잃을까 걱정됨.
다국어 환경에서 Gemini Live를 써보길 권함. 화자를 구분해 실시간으로 통역해 줌. 실제 능력에 비해 정말 저평가되어 있음.
뒤늦게 Claude를 써보고 Gemini의 소통 방식이 훨씬 더 마음에 든다는 사실에 놀랐음. 코딩은 Claude가 더 낫다는 데 이견이 없지만, 지식 작업에서는 원하는 내용을 찾으려고 출력을 한참 뒤져야 했음. 가끔은 거의 이해하기 어려울 정도였음.
Claude에서 넘어온 입장에서는 요즘 ChatGPT도 그리 나쁘지 않음.
방금 써봤는데 강한 억양도 잘 알아듣고, 목소리가 듣기 좋으며 지연 시간도 짧아 보임. 상당히 잘 나온 버전임.
게다가 Workspace 계정으로도 실제 사용할 수 있음. 최근 출시된 기능 대부분은 개인용을 쓰기에도, 기업용을 쓰기에도 애매해서 이용하지 못했는데 이번에는 다름. 앞으로 확실히 쓰게 될 듯함.
다른 언어도 잘하는 듯함. 밖에서 걸으며 대화할 때는 사생활 보호를 위해 다른 언어를 선호함. Siri로 실시간 모드를 실행할 수도 있어 보임.
Gemini가 Fable과 Astra를 넘어서는 날이 올지, 온다면 언제일지 궁금함. 작년이라면 데이터, TPU 하드웨어, 막대한 광고 수익을 가진 Google이 다른 업체를 추월할 것이라고 자신 있게 걸었겠지만 아직 뒤처져 있음. Google 내부에서 익명으로 Gemini 4 출시 시기를 귀띔해 줄 분은 없을까?
일상용 AI로는 3.8 Flash가 이미 넘어섰다고 봄. 대부분의 사람에게 충분히 똑똑하며, 비전 능력도 Astra(Max)에 아주 조금 뒤지는 정도임. 비전은 비전문가들이 좋아하는, 카메라로 무언가를 비추고 질문하는 용도를 뜻함.
속도가 굉장히 빠르고 연산 부담도 작아 자주 느려지지 않음. 현재 이보다 나은 범용 모델은 떠오르지 않으며, 글도 다른 대형 모델보다 자연스럽게 씀.
Google이 코딩 에이전트를 그렇게 탐나는 시장으로 보는지부터 의문임. 가격 경쟁이 극심하고, 지속적으로 차별화하기 어려우며, 고객의 전환 비용도 사실상 없는 시장임.
개발자 고급 사용자보다 검색 통합과 일상 사용자용 Gemini 앱에 집중한 것은 영리한 선택이라고 봄. 자기 영역을 확보했고 그곳에서는 제대로 경쟁하는 상대도 없으며, 기존 수익원과도 직접 연결됨.
코딩 모델이라면 Google이 그 시장에서 싸울 동기가 없다고 봄. 온갖 사업을 하는 Google 입장에서 외부 소프트웨어 엔지니어에게 강력한 코딩 모델을 제공하면 경쟁자만 늘어날 수 있음. Google은 광고만큼 막대한 매출을 내지 못하는 사업을 결국 접는 것으로 유명하며, 코딩 요금제를 파는 사업도 원하지 않을 것임.
Google이 원하는 것은 더 나은 검색과 정보 탐색 도구를 만들어 사용자를 기존 검색·광고·YouTube 생태계로 유도하는 것임. Android와 Chrome을 하는 이유도 그것이며 나머지는 부차적임.
직접 근무해 본 바로는 데이터센터 할당량과 자원 배분을 비용 관점에서 따지는 분위기도 강함. 막대한 이익을 내는 광고 프로젝트조차 자원을 확보하려면 필요성을 입증하고 경쟁해야 함. 외부인에게 TPU를 제공해 잠재적 경쟁 제품을 만들게 하는 것만큼 자원과 수익 측면에서 납득하기 어려운 일도 떠오르지 않음.
클라우드 사업의 일부로 토큰 사용량에 과금하는 것은 괜찮은 수익원이 될 수 있겠지만, 코딩에 맞춰 최적화할지는 의문임.
광고 사업이 없었다면 Google은 벌써 탈락했을 것임. 지금은 거의 BlackBerry나 Nokia처럼 보임.
회사의 Google Workspace Business에서는 Gemini 앱에 3.6 Flash와 Thinking만 표시됨. 3.7이나 3.8이 배포된 분이 있을까?
기본 Workspace 구독에는 3.6 Flash와 3.1 Pro가 포함됨. 새 모델을 사용하려면 Workspace 관리자가 해당 사용자 라이선스를 업그레이드해야 하며, 요금은 현재 월 17달러에서 2027년 1월부터 월 24달러로 오름.
내 Google Workspace for Education 계정에도 여전히 3.6 Flash와 3.6 Thinking만 보임. Gmail의 “Plus” 요금제 계정에는 3.5 Flash-Lite와 3.6 Thinking이 표시됨.
둘 다 쓸 수 있는데, 내 작업의 벤치마크는 3.7이 더 좋음. 그래도 다른 모델들보다 개선된 점은 반가움.
가장 발전했다는 AI 모델이 체스에서 가장 흔한 체크메이트 패턴에 지는 모습을 시연 영상에 넣은 것은 인상이 좋지 않음.
LLM이 불법 수를 두거나 없는 기물을 만들어 내지 않고 체스 한 판을 끝내는 것만으로도 성과임. 실시간 모델이라면 더더욱 그러함. 다만 주변 실행 시스템이 얼마나 도왔는지는 알 수 없음.
실시간 모델로는 충분히 훌륭해 보임. 이 시연을 확장하면 훨씬 즐겁게 대국할 수 있을 듯함. 체스 엔진의 분석 결과를 모델에 넣어주면 원하는 수준의 수를 두게 할 수 있음.
모델이 판세를 이해하는 능력과 실제 수의 수준은 무관해지겠지만, 이를 최신 실시간 음성 모델에 체스를 추가하는 것이 아니라 기존 컴퓨터 체스에 실시간 음성 대화를 추가하는 것으로 보면 꽤 멋진 개선임.
시연 선택이 이상하다는 데 동의하지만, 이유는 따로 있음. 이미 체스 엔진이 있으니 대화 모델까지 체스를 둘 필요는 없음.
3.8은 놀라운 모델이며, 이를 운영하는 인프라는 더 뛰어남. 전부 TPU로 구성된 인프라인가? 성능도 매우 높고 지능도 탄탄함.
개인적으로 Gemini Live Mode는 지능이 훨씬 낮았을 때부터 GPT Voice보다 훨씬 좋았음. 정말 사람과 이야기하는 느낌을 줌. ChatGPT는 내가 무슨 말을 하든 맞장구만 치고 목소리도 좀 이상함.
이번 버전이 기대됨. 다만 Google AI Plus 사용자에게 아직 Gemini 3.8을 제공하지 않는 것은 실망스러움.
OpenAI가 방금 완전한 양방향 동시 대화 모드를 API로 출시했음. 이름은 gpt-live-1인가 비슷한 것이며, 매우 실감 남.
Google이 차기 Gemini Pro 주요 버전을 깜짝 공개해 Anthropic과 OpenAI를 당황하게 만들 생각인지 궁금함. 최첨단 모델 업데이트를 상당히 느긋하게 진행하는 듯함.
GUI 테스트에 적합한 모델을 찾고 있음. 기존 컴퓨터 사용 기능은 느린 스크린샷 반복 방식이라 화면 전환과 애니메이션을 포착하지 못해 적합하지 않음. 문서에 따르면 이번 모델은 최대 1 FPS를 지원하니 충분할 수도 있음. 지금은 안 되더라도 몇 달 안에는 필요한 표본 추출 속도에 도달할 듯함.
모델이 영상을 녹화한 뒤 나중에 프레임별로 읽게 하는 방식만으로도 잘 작동함. Gemini 3.8 Flash라면 그 용도에 충분히 좋을 것임.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기