
AI Daily Digest — 2026년 7월 30일: Gemini 3.6 Flash 등장, 오픈 웨이트(Open-weight) AI 연합
요약
Google DeepMind의 Gemini 3.6 Flash 시리즈 출시와 OpenAI의 ChatGPT 기능 업데이트, 그리고 오픈 웨이트 AI 모델 규제에 반대하는 글로벌 테크 기업들의 공동 서한 발표 소식을 다룹니다.
핵심 포인트
- Gemini 3.6 Flash는 토큰 효율성과 코딩/멀티모달 성능이 대폭 향상됨
- Gemini 3.5 Flash-Lite는 초고속 처리와 압도적 비용 효율성 제공
- OpenAI는 사용자 컨텍스트 유지 및 학술 연구용 기능 등 제품군 확장
- NVIDIA, Microsoft 등 25개 기업이 오픈 웨이트 AI 규제 자제 촉구
Google DeepMind는 7월 21일, 3개의 새로운 Flash 시리즈 모델을 발표했다. 주력 모델인 Gemini 3.6 Flash는 3.5 Flash 대비 출력 토큰(Output Token) 사용량을 17% 절감하였으며, 코딩, 지식 작업(Knowledge Work), 멀티모달(Multimodal) 성능을 향상시켰다. 가격은 입력 100만 토큰당 $1.50, 출력 100만 토큰당 $7.50로, 이전 세대보다 에이전트 태스크(Agent Task)당 비용을 낮추었다.
Gemini 3.5 Flash-Lite는 초당 350 출력 토큰이라는 시리즈 중 가장 빠른 처리 능력을 실현하며, $0.30/100만 입력 토큰이라는 압도적인 비용 효율성을 제공한다. 대규모 문서 처리 및 데이터 추출과 같은 고처리량(High-throughput) 에이전트 워크플로우(Agent Workflow)에 최적화되어 있다. 세 번째 모델인 Gemini 3.5 Flash Cyber는 사이버 보안 특화 모델로, CodeMender를 통해 정부 기관 및 신뢰할 수 있는 파트너에게 한정적으로 제공된다.
주목할 점은 Google이 '파라미터(Parameter) 수 경쟁'에서 '토큰 효율성 × 수직적 특화'로 축을 이동했음을 명확히 했다는 것이다. 3.6 Flash는 DeepSWE에서 49%(3.5 Flash는 37%), MLE Bench에서 63.9%(동일 49.7%), OSWorld-Verified에서 83.0%(동일 78.4%)를 달성했다. 또한, Gemini 3.5 Pro가 파트너 기업과 테스트 중이라는 점과 Gemini 4의 사전 학습(Pre-training)이 이미 시작되었다는 사실도 확인되었다.
— Google Blog · DeepMind Blog
🔗 Gemini 3.6 Flash 발표 · DeepMind Blog · Artificial Analysis Index
OpenAI는 7월 22일부터 29일에 걸쳐 제품 업데이트를 연속적으로 투입했다. 7월 22일에는 OpenAI Presence를 출시했다. 이는 ChatGPT 세션 간에 사용자의 ID와 컨텍스트(Context)를 유지하는 기능을 제공한다. 7월 23일에는 Health in ChatGPT를 발표하여 웰니스 트래킹(Wellness Tracking), 복약 알림, 증상 분류(Triage)를 실현했다. 7월 29일에는 ChatGPT for Academic Researchers가 등장하여 인용 도구 및 논문 분석 기능을 갖추었다.
또한 7월 21일에는 David Vélez(Nubank 창립자)와 Robin Vince(BNY Mellon CEO)의 이사회 참여, ChatGPT Small Business Program의 시작, Hugging Face와의 공동 보안 사고 대응 발표도 있었다.
— OpenAI · Reuters
🔗 OpenAI Presence · Health in ChatGPT · ChatGPT for Academic Researchers · Small Business Program
Microsoft, NVIDIA, Meta, HuggingFace, Mistral, IBM, Dell, Palantir, Perplexity, Replit, Andreessen Horowitz, Y Combinator 등 25개 조직이 7월 24일, 미국 정부에 오픈 웨이트(Open-weight) AI 모델에 대한 조기 규제를 자제해 달라는 공개 서한에 서명했다.
서한은 "오픈 웨이트 AI 모델은 건전한 경쟁을 촉진하고, 더 많은 참여자가 AI 산업의 이익을 공유할 수 있도록 한다"고 주장했다. 배경에는 DeepSeek, Alibaba의 Qwen, Z.ai 등 중국산 오픈 웨이트 모델에 대한 접근 제한을 검토하는 백악관의 움직임이 있다. NVIDIA의 Jensen Huang CEO와 Microsoft의 Satya Nadella CEO는 각각 강력한 지지를 표명했다.
주목할 만한 미서명 진영으로는 Google, Amazon, OpenAI를 꼽을 수 있다. 각 기업은 중국의 오픈 웨이트 생태계와 직접 경쟁하는 독점적(Proprietary) 모델 전략을 유지하고 있다.
— Meta · Microsoft · NVIDIA · HuggingFace
🔗 Meta 공개 서한 · NVIDIA CEO 성명
Poolside AI는 7월 21일, 118B 파라미터의 Mixture-of-Experts 모델인 Laguna S 2.1(토큰당 8B 활성)을 OpenMDW-1.1 라이선스로 공개했다. 100만 토큰의 컨텍스트 윈도우(Context Window)를 지원하며, 사고 모드(Thinking Mode)와 비사고 모드(Non-thinking Mode)를 모두 제공한다.
Terminal-Bench 2.1에서 70.2%를 기록했으며, Poolside는 수 배 더 많은 파라미터(Parameter)를 가진 모델과 대등하거나 그 이상의 성능을 보유하고 있다고 주장한다. 단일 NVIDIA DGX Spark에서 동작 가능한 크기로 억제되어 있어, 셀프 호스팅(Self-hosted) 환경에서의 고부하 에이전트 코딩(Agent Coding)을 현실적으로 만들고 있다. 트레이닝(Training)에는 9주 미만의 기간 동안 4,096개의 NVIDIA H200 GPU가 사용되었다.
— Poolside · NVIDIA · VentureBeat
🔗 Laguna S 2.1 블로그 · HuggingFace 모델
NVIDIA는 7월 21일, 차세대 기가와트급 AI 팩토리용 플랫폼인 Vera Rubin NVL72의 양산 시작과 CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud에서의 채택을 발표했다. CoreWeave의 테스트에서는 이전 세대 대비 와트당 토큰 처리량(Token Throughput)이 10배 향상되었다.
동시에 발표된 Spectrum-6는 102.4Tbps의 이더넷(Ethernet) 스위치 시스템으로, 이전 세대보다 2배의 용량을 갖는다. 수십만 개의 GPU를 연결하는 AI 팩토리 클러스터(Cluster)를 위해 설계되었으며, NVIDIA는 인프라 경쟁이 '단일 칩의 피크 FLOPS'에서 '시스템 전체의 효율'로 전환되었다고 규정하고 있다.
— NVIDIA Blog · Microsoft Azure
🔗 NVIDIA Vera Rubin 발표 · Spectrum-6 발표
ByteDance Seed 팀은 7월 7일, AI 에이전트가 실제 환경에서 학습하는 속도에 관한 획기적인 연구(arXiv:2607.05155)를 발표했다. 5개의 프런티어(Frontier) AI 모델을 과학적 발견부터 소프트웨어 엔지니어링, 게임에 이르기까지 134개의 실제 세계 태스크(Task)에서 연속 12시간 동안 작동시켜, 약 38,000 에이전트 시간(Agent-hours)의 상호작용 데이터를 축적했다.
핵심 발견: 에이전트의 학습 곡선은 정밀한 대수 시그모이드 법칙 (Log-sigmoid law) (R²=0.998)을 따르며, 환경으로부터의 학습 속도는 2025년 9월부터 2026년 4월 사이 약 3개월마다 두 배씩 증가하고 있다. 이 추세가 지속된다면, 현재 12시간이 소요되는 에이전트 학습 태스크는 6개월 후에는 3시간, 12개월 후에는 1시간 미만이 될 것으로 계산된다.
— ByteDance Seed · arXiv
🔗 EdgeBench 논문 · AI 도구 일보
칭화대학교 AIR 연구소와 ByteDance Seed의 공동 연구팀은 7월 28일, 강화학습 (RL) 훈련에서 실제로 변화하는 파라미터가 전체의 **단 0.58%**에 불과하다는 것을 발견했으며, 해당 파라미터들에 대한 외과적 후처리(SAR: Subspace Alignment Rewiring, 부분 공간 정렬 재배선)를 통해 재학습 없이 추론 능력을 향상시키는 방법을 발표했다 (arXiv:2607.03065).
SAR는 RL 훈련이 실제로 모델 동작을 변경하는 저차원 부분 공간(Low-dimensional subspace)을 식별하고, 크로스 태스크 간섭(Cross-task interference)을 제거하도록 변경 사항을 재배분한다. 결과적으로 더 적은 활성 파라미터(Active parameter)로 더 높은 벤치마크 점수를 달성하였으며, 테스트 시 계산(Test-time computation)의 포화 현상도 완화되었다.
— 칭화대학교 AIR · ByteDance Seed · arXiv
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기