Google, 더 강력한 모델 대신 더 저렴한 Gemini에 집중
요약
Google이 비용 효율성을 극대화한 세 가지 새로운 Gemini Flash 모델을 공개했습니다. 3.6 Flash는 출력 토큰 소비를 줄여 비용을 절감하면서도 이전 하이엔드 모델을 능가하는 성능을 보여줍니다.
핵심 포인트
- Gemini 3.6 Flash 출시로 출력 토큰 소비량 및 비용 대폭 절감
- DeepSWE 벤치마크에서 최대 65%의 비용 절감 효과 달성
- 사이버 보안 특화 모델인 3.5 Flash Cyber 및 CodeMender 에이전트 공개
- 고성능 모델보다 저렴한 미드레인지 모델을 통한 시장 전략 강화
핵심 요약
- Google은 대규모 AI 에이전트를 낮은 비용으로 실행하기 위해 설계된 세 가지 Gemini Flash 모델(3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber)을 출시합니다.
- 작업용 모델인 3.6 Flash는 3.5 Flash보다 출력 토큰(output tokens)을 17% 적게 소비하며, DeepSWE 벤치마크에서는 최대 65%까지 적게 소비합니다. 가격은 생성된 토큰 100만 개당 7.50달러입니다.
- 기대되는 플래그십 모델인 Gemini 3.5 Pro는 여전히 파트너사들을 대상으로 테스트 중이며, Gemini 4의 사전 학습(pre-training)이 막 시작되었습니다.
- 사이버 보안 모델인 3.5 Flash Cyber는 CodeMender 에이전트를 통해 정부 및 엄선된 파트너들에게만 제공됩니다.
Google은 화요일 세 가지 새로운 Gemini를 공개했으며, 그 핵심 논거는 두 마디로 요약됩니다: 더 저렴하다는 것입니다. 작업용 모델에서 출력 토큰을 17% 줄였고, 100만 개당 가격을 인하했으며, 각 작업마다 비용이 덜 드는 에이전트를 제공합니다. 한편, 업계 전체가 기다려온 하이엔드 모델인 Gemini 3.5 Pro는 여전히 찾아볼 수 없습니다. 이러한 대조는 그 어떤 순위표보다 Google의 전략을 더 잘 보여줍니다.
'17% 토큰 감소'는 어디에서 왔는가
이 수치는 독립적인 벤치마크 애그리게이터인 Artificial Analysis Index에서 나온 것으로, 3.6 Flash가 3.5 Flash와 비교하여 동일한 작업을 수행하는 데 소비하는 출력 토큰(모델이 생성하는 텍스트 단위)의 양을 정확히 측정합니다. 생성되는 토큰이 적다는 것은 추론(reasoning) 단계와 도구 호출(tool calls)이 적다는 것을 의미하며, 결과적으로 비용이 급감함을 뜻합니다.
Google은 특정 사례에서 그 기준을 더 높게 설정했습니다. 프로그래밍 벤치마크인 DeepSWE에서 최대 65%의 비용 절감을 달성했습니다. 입력 100만 토큰당 1.50달러, 출력 100만 토큰당 7.50달러의 가격으로, 3.6 Flash는 이를 대체하는 3.5 Flash보다 저렴하면서도 벤치마크에서는 이전의 3.1 Pro를 능가합니다. 즉, 오늘날의 미드레인지 (mid-range) 모델이 훨씬 더 저렴한 비용으로 어제의 하이엔드 (high-end) 모델을 매장하고 있는 것입니다. 이것이 바로 미끼 상품 (loss leader)입니다.
실질적인 이득, 여전히 닿지 않는 정점
품질 저하 없이 장황함 (verbosity)을 줄이는 것이 핵심 성과이며, 제시된 수치들이 이를 뒷받침합니다. DeepSWE에서 정확도는 37%에서 49%로 상승했습니다. 머신러닝 (machine learning) 연구 작업을 평가하는 MLE Bench에서는 49.7%에서 63.9%로, 컴퓨터 제어 능력을 테스트하는 OSWorld-Verified에서는 78.4%에서 83%로 상승했습니다. 지적 작업 점수인 GDPval-AA v2는 1,349점에서 1,421점으로 올랐습니다. 모델이 브라우저와 데스크톱을 조작할 수 있게 하는 Computer Use 기능은 Gemini API의 클라이언트 측 통합 도구가 됩니다.
다만, 이러한 이득은 경쟁사가 아닌 이전의 Gemini 모델들과 비교했을 때의 수치입니다. Google 스스로도 자사의 모델들이 미국과 중국의 최고 연구소들에 비해 뒤처져 있음을 인정하고 있습니다. 기술 팀의 Logan Kilpatrick은 X(구 트위터)에서 비판에 대해 이를 인정했습니다. 명시된 목표는 효율성, 신뢰성, 그리고 비용이었으며, 성능은 그 과정에서 향상되었다는 것입니다. 다시 말해, Google은 이번에 1위 자리를 탈환하는 것을 목표로 삼지 않았다는 뜻입니다.
대량 처리를 위한 Flash-Lite, 국가 기관을 위한 Cyber
비용 논리는 나머지 두 모델에도 적용됩니다. Gemini 3.5 Flash-Lite는 처리량 (throughput)을 목표로 합니다. Artificial Analysis Index에 따르면, 이 모델은 입력 100만 토큰당 0.30달러, 출력 100만 토큰당 2.50달러의 가격으로 초당 350 토큰을 처리합니다. 이 모델의 타겟은 티켓 분류, 데이터 추출과 같이 요청당 단 1센트가 중요한 대량의 반복적인 작업입니다. 이 모델은 여러 에이전트 기반 (agentic) 벤치마크에서 더 규모가 큰 이전 모델인 3 Flash를 능가하기까지 합니다. Terminal-Bench 2.1 점수는 직전 모델 대비 31%에서 54%로 급등했습니다.
세 번째 모델인 3.5 Flash Cyber는 독자적인 역할을 수행합니다. 3.5 Flash를 기반으로 구축되어 소프트웨어 보안에 최적화된 이 모델은 Google DeepMind의 코드 수정 에이전트 (code correction agent)인 CodeMender에 동력을 공급합니다. 이 모델의 강점은 정확히 비용에 있습니다. CodeMender는 단 하나의 보고서를 작성하기 위해 이 모델을 최대 5번까지 호출하며, 단일 대형 모델을 사용할 경우 비용이 급격히 비싸질 수 있는 코드베이스 반복 작업에서 여러 차례의 패스 (pass)를 수행합니다. CyberGym 벤치마크에서 이러한 접근 방식은 Chrome의 JavaScript 엔진인 V8에서 55개의 고유한 취약점을 확인했는데, 이는 Claude Opus 4.6이 찾아낸 36개보다 많은 수치이며, 그중 10개는 다른 모든 모델이 놓쳤던 것이었습니다. 하지만 이 모델은 공개되지 않을 것입니다. Google은 사이버 보안의 이중 용도 (dual-use) 특성을 고려하여 이 모델을 정부 및 신뢰할 수 있는 파트너들에게 우선적으로 제공할 예정입니다.
Gemini 3.5 Pro의 부재, 이미 개발 중인 Gemini 4
가장 시사하는 바가 큰 것은 Google이 내놓지 않은 결과물입니다. Gemini 3.5 Pro는 여전히 "파트너사에서 테스트 중"이며 "준비되는 대로" 출시될 것이라고 하는데, 이는 누구도 믿지 않을 표현입니다. 동시에 회사는 Gemini 4를 위한 "가장 야심 찬 사전 학습 (pre-training) 런"을 시작했다고 발표하며 "진전에 고무되어 있다"고 말했습니다. 핵심 모델이 부재한 상황에서 이 두 메시지를 나란히 배치하는 것은 로드맵이라기보다는 기대감을 관리하려는 전략에 가깝습니다.
신호는 우선순위의 순서에 담겨 있습니다. 정점에 있는 모델을 공개하기 전에 세 가지 비즈니스 모델을 정렬하는 거대 기업은 우선 대규모 배포를 목표로 하고 있습니다. 즉, 호출(call) 하나하나가 최종 비용에 영향을 미치는 수천 개의 프로덕션(production) 에이전트들입니다. 다음 라운드는 벤치마크 순위표의 1% 차이보다는, AI를 대규모로 도입하는 기업들의 예산에서 결정될 것입니다.
내 의견
이러한 행보는 새로운 표준처럼 보이며, 저는 이를 약점의 인정으로 해석하지 않습니다. 플래그십(flagship) 모델을 아껴두면서 세 가지 저렴한 모델을 출시하는 것은 경기장의 규칙을 바꾸는 것입니다. 에이전트 모델의 가치는 더 이상 순위표의 상단이 아니라, 수행된 작업당 달러($)로 측정됩니다. Google은 이를 암묵적으로 인정하고 있으며, 경쟁사들도 올해가 끝나기 전에 이를 따를 것입니다. 왜냐하면 우리는 벤치마크에 비용을 지불하는 것이 아니라, 토큰(tokens)에 비용을 지불하기 때문입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기