AGI에 대한 두 경쟁적 베팅: Google I/O 하이라이트
요약
Google I/O 이벤트 하이라이트를 분석하며, Google은 검색창 기반의 AI 포털 전략을 강조했습니다. 핵심은 모든 기능에 '충분히 좋은(good enough)' AI를 통합하는 것이며, 특히 Gemini Omni 모델을 통해 멀티모달리티와 비디오 생성 능력을 크게 발전시켰습니다. 이는 OpenAI가 채팅창 중심의 포털을 구축하려는 것과 대비됩니다.
핵심 포인트
- Google은 검색창 기반의 AI 포털 전략에 집중했습니다.
- Gemini Omni는 모든 입력으로부터 다양한 출력을 목표로 합니다.
- 비디오, 이미지 등 멀티모달 생성 능력이 크게 향상되었습니다.
- AI 기능 통합을 통한 '충분히 좋은' 사용자 경험 제공이 핵심입니다.
이 영상은 어제 몇 시간 동안 진행된 Google AI 이벤트의 배경에 있는 더 큰 이야기들을 보여주는 여덟 가지 순간과, 이벤트를 앞두고 지난주에 제가 본 수많은 연구소 리더 인터뷰에서 얻은 진정한 신호라고 할 수 있는 두 개의 클립으로 구성되어 있습니다. 그리고 무료 보너스로는 LLM에 대한 새로운 독립 논문 하이라이트도 담겨 있어 모델의 역량을 좀 더 입체적으로 이해하는 데 도움이 될 것입니다.
모델들이 실제로 무엇이 사실인지에 대해 어떤 아이디어를 가지고 있을까요? 만약 많은 사람들이 저를 포함하여 느낀 분위기만 알고 싶다면, 제가 정리해 드리겠습니다. IO는 OpenAI로부터 소비자들의 마음을 사로잡으려는 Google의 눈에 띄는 시도였습니다. 검색창을 통해 할 수 있는 모든 멋진 것들을 보여주었으며, Claude 사용자들로부터 전문 사용자를 빼앗아 오려는 것에 관한 것보다 훨씬 더 많은 것이었습니다. Google은 심지어 새로운 모델들이 코딩 면에서 어떤 새로운 영역에 도달했다고 주장하려고 노력조차 하지 않았습니다. 예를 들어, 새로운 Anti-gravity 2는 에이전트적 코딩(agentic coding) 측면에서 결코 뒤떨어지지 않습니다.
최신 모델을 기반으로, 이 모델은 한 시간도 안 되어 제가 즐겁게 플레이했던 이 인터랙티브 어드벤처 게임을 상당히 능숙하게 만들어냈습니다. 동일한 작업을 받았을 때 GPT-5.5가 보여준 것보다 버그가 적었으며, 여러분은 이 인터랙티브 어드벤처를 시작하고, 영웅을 선택하며, 정말 멋진 음악 기반의 모험을 경험할 수 있습니다. 물론 이미지들은 Google의 Nano Banana Pro에 의해 실시간으로 생성된 것입니다. 하지만 아닙니다. 어제 이벤트의 초점은 진정한 전문적인 성능이 아니었습니다.
초점이 맞춰진 것은 '충분히 좋은(good enough)' AI를 여러분이 검색창에서 요청할 수 있는 모든 것에 통합하는 전략을 보여주는 것이었습니다. 간단히 말해, Google은 기본적으로 검색창을 모든 AI 기능을 사용하는 포털로 만들고 싶어 합니다. 반면, 역사적으로 소비자에게 더 초점을 맞추었던 OpenAI는 채팅창을 검색을 사용하는 포털로 만들고 싶어 합니다. 그렇게 해야 당연히 광고를 더 많이 팔 수 있기 때문입니다. 만약 이런 분위기라면, 소비자인 여러분이 ChatGPT의 채팅창을 사용할지 Google의 검색창을 사용할지에 대한 싸움에서 제가 언급했던 그 여덟 가지 순간들은 무엇이었을까요?
첫 번째는 GPT-4o와 관련하여 다소 특이한데, 누가 'O'가 무엇을 의미했는지 기억하나요? 만약 'Omni'라고 말했다면 잘 하신 겁니다. 하지만 OpenAI에서 오래전에 은퇴했던 그 이름은 이제 Google에 의해 차지되었으며, 모든 입력으로부터 모든 출력(오디오를 비디오로, 이미지를 음성으로)을 목표로 합니다. 현재 초점은 비디오 출력에 맞춰져 있었고, 저는 이것이 IO에서 가장 많이 사용될 것이라고 보았습니다. 'Gemini Omni'를 발표하게 되어 기쁩니다. >> [박수] >> 모든 입력으로부터 무엇이든 생성할 수 있는 저희의 새로운 모델입니다. 이 모델은 Gemini의 지능과 최고의 생성 미디어 모델들을 결합하여, 세계 이해력(world understanding), 멀티모달리티(multimodality), 그리고 편집에 새로운 수준을 가져옵니다.
VEO, Nano Banana, Genie 같은 모델들은 극도로 사실적인 비디오, 이미지, 인터랙티브 시뮬레이션을 생성할 수 있습니다. 완벽하지는 않지만, 이미 직관적인 물리 개념의 인상적인 개념들을 보여주고 있습니다. 그리고 Omni를 통해 우리는 훨씬 더 많은 진전을 이루었습니다. 운동 에너지(kinetic energy)나 중력 같은 것을 시뮬레이션하는 데 있어 한 단계 발전한 것입니다. 이전 시스템들은 이러한 개념들을 어려워했을 것입니다. Omni 모델은 모든 유료 Gemini 구독에서 사용할 수 있지만, 제가 제한적으로 테스트해 본 바로는 비디오나 이미지를 입력으로 받았을 때 거의 아무것도 생성하기를 거부했습니다.
현재 어떤 제한이 있는지 모르겠지만, 너무 과도하게 제한적입니다. 작동하는 경우의 품질은 중국 비디오 생성 모델인 C dance 2 수준이라고 할 수 있습니다. 이제 저는 더 큰 이야기에 집중할 것입니다. 왜냐하면 Omni와 관련하여 Demis Hassabis가 하는 훨씬 더 큰 주장은 이러한 월드 제너레이터(world generators), 비디오 제너레이터(video generators)가 AGI, 즉 인공 일반 지능(artificial general intelligence)으로 가는 핵심 단계라는 것입니다. 논리는 세상을 정확하게 시뮬레이션할 수 있다면 그것을 이해할 수 있다는 것입니다.
인공 일반 지능은 불과 몇 년 거리에 있습니다. 오늘 저는 AGI를 구축하기 위해 우리가 이룬 발전을 공유하게 되어 기쁩니다. 작년에 저는 Gemini의 놀라운 멀티모달(multimodal) 기능을 확장하여 월드 모델(world model)이 되는 비전을 제시했습니다. 세상을 이해하고 시뮬레이션할 수 있는 AI입니다. 이것은 AGI를 달성하는 데 중요한 측면이며, AI 어시스턴트 구축부터 로봇 훈련에 이르기까지 모든 것에 중요할 것입니다. 하지만 OpenAI로부터 이름의 바통을 이어받는다는 이야기를 하자면, Sam Altman과 동료들이 2024년 초부터 자신들의 비디오 생성 모델인 Sora가 AGI로 가는 바로 그 디딤돌이었다고 주장했다는 것을 알고 계셨나요? 그것은 현실 세계를 이해하고 시뮬레이션할 수 있는 모델의 기반이 될 것이라고 했습니다. 저는 이 채널에서 이에 대해 이야기했습니다. 그들은 이것이 AGI 달성에 중요한 이정표라고 말했습니다. 하지만 잠깐, Sora 앱은 이제 보류되었고 Sora 기술은 내부 로봇 공학 부서로 격하되었습니다. 이것은 Google과 두 거대 경쟁사 OpenAI 및 Anthropic 사이의 핵심적인 새로운 차이점입니다. OpenAI 공동 창립자이자 사장인 Greg Brockman에 따르면, 텍스트만으로도 일반 지능이라는 타이틀에 걸맞은 무언가에 필요한 자기 개선(self-improvement)을 포함한 종류의 돌파구를 얻을 수 있습니다.
좋습니다. 그럼 왜 당신의 베팅이 이쪽(world model)에 있지 않은지 조금 말씀해 주시겠어요? 비디오가 사물이 어디로 가는지 이해하는 세계 모델 버전 같은 것이 명백히 로보틱스에 유용합니다. 그런데 왜 Sora에서 실질적인 진전을 보여주고 있는 이 분야 대신 GPT 추론 모델 트리에 베팅하시는 건가요? 그러니까, 비디오 생성의 발전을 보면, 아시다시피 Generation 1, 2, 3은 엄청났습니다. 그래서 당신의 베팅이 어디에 있는지 궁금합니다. 이 분야의 문제는 기회가 너무 많다는 것입니다.
맞죠? OpenAI에서 우리가 아주 초기에 관찰했던 것은, 우리가 상상할 수 있는 모든 것이 작동한다는 것입니다. 물론 여기에는 마찰(friction)의 정도, 필요한 엔지니어링 노력, 컴퓨팅 요구 사항 등 다양한 수준이 있지만, 수학적으로 건전한 거의 모든 다른 아이디어에 대해서는 실제로 꽤 좋은 결과를 얻기 시작할 수 있습니다. 그래서 세계 모델에서도 그렇게 할 수 있고, 과학적 발견에서도 그렇게 할 수 있으며, 코딩에서도 그렇게 할 수 있습니다.
아시다시피, 텍스트 모델이 얼마나 멀리 갈지에 대한 논쟁이 있었습니다. 텍스트 지능은 어디까지 갈 수 있을까요? 세상이 어떻게 작동하는지에 대한 실제적인 개념을 가질 수 있을까요? 그리고 저는 우리가 그 질문에 명확하게 답했다고 생각합니다. 그것은 AGI로 나아갈 것이라는 것입니다. 우리는 시야(line of sight)를 보고 있으며, 지금 이 지점에서 올해 나올 훨씬 더 좋은 모델들이 있다는 것을 알고 있습니다. 그리고 OpenAI 내부에서 컴퓨팅 자원을 어떻게 할당할지 결정해야 했던 그 압박감은 시간이 지나도 줄어들지 않고 오히려 증가하고 있습니다.
하지만 이 순간은 거의 정반대의 이야기였습니다. 왜냐하면 AGI로 가는 길이 OpenAI와 Google이 서로 다른 방향으로 나아가는 예시라면, IO 행사에서 잠깐 언급된 것은 그들이 같은 방향으로 가고 있다는 예시였기 때문입니다. 중간쯤에 구글은 다른 회사들과 함께 OpenAI가 SynthID를 자사 제품에 통합할 것이라고 발표했습니다. 본질적으로, ChatGPT의 GPT-2를 사용하여 이미지를 생성하거나 편집하더라도, 이제 누구나 Gemini로 그것을 쉽게 확인할 수 있게 된 것입니다. 이것이 바로 구글 기술인 SynthID입니다.
회사들이 일치하는 분야에 대해 말하자면, 구글은 또한 OpenAI와 함께 미 국방부(Pentagon)와 계약을 체결하여 AI를 군사적으로 법적 사용(lawful use)할 수 있도록 허용했습니다. 몇 달 전 Anthropic이 같은 조건에 저항했던 점을 고려하면 언급할 가치가 있는 것 같습니다. 세 번째 순간은 물론 행사에서 발표된 주요 신규 LLM인 Gemini 3.5 Flash와 관련됩니다. 네, 저는 며칠 동안 이것을 테스트해 왔는데, 확실히 빠르고 성능 면에서는 훌륭한 모델인 Gemini 3.1 Pro와 유사하다고 할 수 있습니다.
더 조용하게 발표된 사실은 API를 통해 Pro 시리즈로 사용할 경우 가격도 상당히 비슷하다는 것입니다. 하지만 솔직히 말해서 요즘에는 비교하기가 어렵습니다. 왜냐하면 모델이 사용 사례에 대해 얼마나 많은 토큰을 사용하는지에 달려 있기 때문입니다. 하지만 간단하게 하자면, 동일한 수준의 성능 대비 10배 더 저렴하다는 점에서 확실히 큰 돌파구는 아닙니다. 속도는 훌륭하지만, 여기에는 명백히 모델 자체만큼이나 그 뒤에 있는 하드웨어가 보완되고 있습니다.
지능(intelligence)과 출력 속도(output speed)를 비교해 보면, 지능 부분은 여러 벤치마크 클러스터에서 인공 분석을 통해 측정됩니다. 가장 오른쪽에는 Gemini 3.5 Flash가 이 특정 벤치마크들에서 비슷한 성능 수준의 모델보다 훨씬 더 많은 토큰을 초당 출력하는 것을 볼 수 있습니다. 하지만 중요한 점은, 만약 10개의 다른 벤치마크를 선택한다면 결과가 다르게 나올 수 있으며, 가장 많이 인용되거나 중요한 벤치마크 세트는 항상 변화하고 있다는 것입니다. 거의 2년 된 상대적으로 베테랑인 저만의 벤치마크인 Simple Bench(상식 논리 및 속임수 질문 테스트)에서는 Gemini 3.5 Flash가 정말 상당히 잘 수행합니다.
이는 Gemini 시리즈의 뛰어난 성능과 매우 일치하는데, 저는 이것이 공간 지능(spatial intelligence) 덕분이라고 생각합니다. 많은 트릭들이 대부분의 모델이 포착하지 못하는 공간에서 움직이는 것들과 관련되어 있습니다. 잠시 후에 다룰 Gemini 3.5 Pro가 인간 기준선에 도달했거나 그 근처일 것이라고 해도 전혀 놀랍지 않을 것입니다. 다만, 일반 추론(general reasoning)은 요즘 좀 덜 유행하며, 전문적인 사용 사례(professional use cases)에 더 초점이 맞춰져 있습니다. 이 부분이 바로 연구소들의 수익원입니다. 자, 그럼 Vibe Code Bench v1.1을 살펴보겠습니다.
여기에서도 Gemini 3.5 Flash가 상당히 낮은 지연 시간(low latency)을 보이는 것을 볼 수 있지만, GPT-5.5나 Claude Opus 4.7 같은 모델과 비교했을 때 앱을 '바이브 코딩(vibe coding)'하는 측면에서는 최고 성능은 아닙니다. 하지만 다시 한번 말씀드리지만, 이러한 원시적인 벤치마크는 역량을 과소평가할 수 있습니다. 왜냐하면 제가 Gemini 3.5 Flash로 구동되는 antigravity를 사용했을 때, 보시다시피 말풍선이 있는 이런 인터랙티브 어드벤처를 만들고 여러분이 어드벤처를 진행하며 다른 옵션을 선택할 수 있었다는 사실 때문입니다. 이는 이러한 모델들을 사용하여 무언가를 '바이브 코딩'해 본 적이 없는 제 청중의 일부에게는 모델들이 얼마나 좋아졌는지에 대해 매우 놀라움을 줄 수도 있다는 것을 의미합니다.
Gemini 3.5 Flash가 인공지능의 최전선에 완전히 도달한 것은 아니기 때문에 이 부분에 많은 시간을 할애하지는 않겠지만, 몇 가지 더 언급하고 싶은 벤치마크들이 있었습니다. 첫째로, Finance Agent V2에서의 성능을 주목하셨나요? 이것 역시 Valse AI가 만든 것으로, 재무 분석 및 의사 결정과 관련이 있습니다. 그들에 따르면, 이 작업은 정확한 숫자와 특정 산업 관행에 의존하는 더 어려운 다단계 금융 업무를 포함합니다. 자, 여기 Gemini 3.5 Flash가 Opus 4.7이나 GPT-5.5를 포함한 모든 다른 모델들을 능가하는 것을 볼 수 있습니다.
이는 Google이 Gemini 에이전트를 전문가들이 선택할 모델로 만들려는 노력을 포기하지 않았음을 암시합니다. 그리고 Gemini 모델의 또 다른 큰 숨겨진 강점 중 하나는 표와 차트를 탐색하는 능력입니다. Charkhive 추론을 확인해 보세요. 이것은 아카이브 논문을 사용한 차트 분석 추론과 같은 것입니다. 복잡한 차트에서 정보를 종합할 수 있나요? 네, 84.2%로 다시 한번 모든 다른 모델들을 능가하며 Gemini 3.5 Flash는 확실히 할 수 있습니다. 한 가지 더 말씀드리자면, 이 모든 수치는 Flash 시리즈에 대한 것입니다.
Gemini 3.5 Pro는 어떤 결과를 얻을까요? 즉, Gemini 시리즈가 법률이나 금융 같은 특정 직업 분야에서 최전선이 되는 코딩과 다른 전문직 간의 분기화(divergence)를 볼 수 있을까요? 많은 사람들이 AI가 단일 지능으로 지배하는 방식으로 작동할 것이라고 상상하지 못했지만, 이 분기화는 과소평가된 현실일 수 있습니다. 물론 제가 이것은 Gemini 3.5 Pro가 나오기 전의 이야기라고 했지만, 지금 바로 공개된 내용이 있습니다. 간단한 내용이지만 채널의 오랜 스폰서인 AssemblyAI에서 온 것입니다.
그들은 이제 제가 시연할 수 있는 음성 에이전트 API를 가지고 있습니다. 이것은 완전히 실시간으로 작동하니 한번 사용해 봅시다. 이봐요, AssemblyAI의 음성 에이전트야. 가격 책정이나 작동 방식에 대해 이야기하거나 다른 언어로 전환하는 것을 들어보고 싶니? 사실, 내가 '2달러 14센트 더하기 2달러 36센트는 얼마예요?'라고 물을 때 내 영국식 억양을 이해할 수 있니? 물론이죠, 4달러 50센트입니다. 영국식이든 아니든, 수학은 수학이죠. 실제로 정말 좋은 지적이에요. 맞아요, 정확히 $4.5이고, 이것 모든 문자-숫자 정확도에 대한 시간당 가격이랍니다. 사용해 보려면 설명란의 제 고유 링크를 자유롭게 이용하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube AI Explained (AI 뉴스)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기