Gemini 4 Argon이 프론티어 성능으로 게이트 리리즈로 출시되다
요약
Google은 Gemini 4 Argon을 프론티어 성능의 모델로 출시하며, DeepSWE v1.1(77.9%), Zapier AutomationBench(51.3%) 등 여러 벤치마크에서 공동 1위를 기록했습니다. 특히 출력 한도를 64K에서 1M 토큰으로 대폭 상향하여 장기 워크플로우에 적합함을 강조합니다. 다만, 이 모델은 보안팀이 사용할 수 있는 '게이트 리리즈' 형태로 접근성이 제한적입니다.
핵심 포인트
- DeepSWE v1.1 등 주요 벤치마크에서 공동 1위 성능을 입증했습니다.
- 출력 토큰 한도가 기존 64K에서 최대 1M으로 대폭 증가했습니다.
- 모델은 보안 취약점 수정 및 분석에 특화된 '게이트 리리즈' 형태로 제공됩니다.
- Google의 인프라를 통해 메모리 최적화 및 커널 확장 능력을 보여줍니다.
요약 (TL;DR)
- 공개된 수치는 구체적입니다: DeepSWE v1.1에서 77.9%, Zapier의 AutomationBench에서 51.3%, LVBench에서 91.7%, CWE-bench v1에서 68%로 공동 1위를 차지했으며, 출력 한도는 64K 토큰에서 1M으로 상향되었습니다.
- 벤치마크 주장은 Google 자체 측정치이며, 이는 정상적이고 누구나 이를 바탕으로 로드맵을 재구축하기 전에 언급할 가치가 있습니다.
- Google이 제시하는 모델의 가치는 자사의 인프라를 통해 입증됩니다: 에이전트들이 메모리 최적화를 적용하여 300 TiB가 넘는 용량을 확보했으며, Rust 마이그레이션은 수만 줄에서 최대 800K 라인 커널까지 확장되었습니다.
- 빌드 결정은 오늘 귀하의 팀이 할 수 있는 일에 달려 있으므로, 실질적인 조치는 이미 가지고 있는 라우팅 레이어를 유지하고 접근이 열릴 때 게이트 티어(gated tier)를 파일럿하는 것입니다.
2026-09-30 Google 발표 내용
이 조합은 주의 깊게 읽을 가치가 있습니다. 왜냐하면 두 가지가 동시에 언급되고 있기 때문입니다. 능력은 프론티어 수준으로 제시되는 반면, 접근성은 제한됩니다. 보안팀이 취약점을 찾고 수정하는 데 사용할 수 있는 모델인 동시에, 보안팀이 무언가를 찾아내고 파괴하는 데 사용할 수도 있는 모델이며, 벤더는 자체 평가 결과가 나올 때까지 두 번째 위험이 첫 번째 위험을 압도한다고 결정했습니다.
Gemini 4 Argon 출시 게시물(blog.google, 2026-09-30, 2026-10-04 조회): 2026-09-30에 발표되고 검증된 사이버 디펜더들에게 먼저 공개되는 모델.
Argon에 첨부된 Google의 수치들
게시물에 제시된 수치들은 구체적이며, 기술 구매자가 관심을 갖는 영역들을 포괄합니다. Google이 실제 환경의 장기적인 소프트웨어 엔지니어링을 측정한다고 설명하는 DeepSWE v1.1에서 Argon은 77.9%를 기록했습니다. 핵심 비즈니스 기능 전반에 걸친 종단 간(end-to-end) 실행을 측정하는 Zapier의 AutomationBench에서는 51.3%로 최고 순위를 차지했습니다. 장기 영상 이해를 위한 LVBench에서는 Google이 현존 최고 수준(state of the art)으로 91.7%를 보고합니다. 모델이 보안 취약점을 수정하는 능력을 평가하는 CWE-bench v1에서는 Argon이 68%라는 높은 점수로 공동 1위를 차지했으며, 이는 Gemini 3.8 Flash Cyber가 CWE-bench v0에서 달성한 성능을 기반으로 합니다.
시스템 설계 방식에 영향을 미치는 두 가지 추가적인 세부 사항들이 있습니다. 출력 토큰 제한은 기존 64,000개에서 업계 최고 수준인 1백만 토큰으로 증가했습니다. 이는 다섯 자리 수의 배수로, 장기 마이그레이션이나 대규모 문서 워크플로우에서 단일 요청이 생성할 수 있는 결과물의 규모를 변화시키는 요소입니다. 도입 기간 이후의 가격은 입력 토큰당 4달러, 출력 토큰당 20달러로 책정되었는데, 이는 출시 시점의 요율보다는 계획을 세워야 할 기준 금액입니다.
이 모든 수치들은 Google 자체 측정 결과입니다. 이는 출시 시점에 일반적인 관행이며, 따라서 신중한 팀들이 출시 게시물을 가설(hypothesis)로 취급하는 이유이기도 합니다. 벤치마크 결과는 특정 공급업체의 구성 하에서 모델이 벤치마크 상에서 어떤 성능을 보였는지 알려줄 뿐입니다. 그것이 귀사의 계약 템플릿, 레거시 마이그레이션 또는 인시던트 대기열에서 어떻게 작동할지는 알려주지 않습니다.
Google의 출시 게시물(blog.google, 2026-09-30)에 제시된 수치들로 만든 Netics 편집자 지표 그리드: 접근성보다는 역량과 용량을 설명하는 네 가지 공개 수치.
발표에서 언급된 엔지니어링 예시
발표에서 언급된 엔지니어링 예시
가장 흥미로운 부분은 벤치마크가 아닙니다. Google은 에이전트들이 전체 플릿(fleet-wide) 프로파일링 원격 측정 데이터(telemetry)를 분석하여 데이터센터 전반에 걸쳐 메모리 최적화를 식별하고 적용함으로써, 배포 후 300 TiB 이상의 메모리를 확보했으며, 총 절감량은 추정치로 500 TiB에서 1 PiB에 달한다고 설명합니다. 또한 이들은 회사 전반의 C 및 C++ 코드베이스를 Rust로 마이그레이션하는 에이전트 사례도 언급하는데, 이는 re2나 libgav1 같은 핵심 라이브러리의 수만 줄부터 Fuchsia Zircon 커널의 80만 줄 이상에 이르기까지 규모가 커졌으며, 이러한 재작성은 프로덕션 환경에 도달하기 전에 자동화 및 수동 감사(auditing), 에뮬레이션 테스트, 검토를 거친다는 점을 강조합니다. 한 예시로, 에이전트들은 libgav1 비디오 디코더의 32,000줄 SIMD 코드를 교체하여 메모리 안전성을 확보한 결과를 얻었으며, 이는 이전 Rust 포팅 버전보다 2.7배 빠른 속도로 동일한 비디오 출력을 구현했습니다.
이를 역량 과시가 아닌 배포 패턴으로 이해해야 합니다. 이 에이전트들은 프로덕션 플릿과 커널 근접 코드에 작용하며, 모든 예시는 감사(auditing), 에뮬레이션, 검토 게이트로 둘러싸여 있습니다. Google은 또한 에이전트 제어 로드맵에 따라 고위험 훈련이나 평가가 시작되기 전에 격리하고 봉인함으로써 샌드박스 환경을 강화하고 있으며, 이러한 관행을 파트너들과 공유할 계획이라고 밝힙니다.
이는 에이전트 배포를 규제 대상 클라이언트에게 판매하는 모든 사람들에게 어색한 함의를 던집니다. 만약 프론티어 에이전트의 참조 구현(reference implementation)이 공급업체 자체 시설 내부, 감사 및 에뮬레이션 게이트 뒤에서 실행된다면, 통제 설계 질문은 어떤 모델이 가장 똑똑하냐가 아닙니다. 누가 그 '게이트'를 소유하고 있느냐입니다.
게이티드 릴리즈(gated release)가 빌드 결정에 영향을 미치는 이유
게이티드 릴리즈(gated release)는 청중을 두 그룹으로 나누며, 팀은 이 분할에 맞춰 계획해야 합니다. 검토자들은 수치를 읽을 수는 있지만 자신들의 과제에 직접 실행해 볼 수는 없습니다. 파트너 프로그램 내의 방어팀은 이를 실행하고 보고할 수 있습니다. 나머지 모든 사람들은 기다릴지, 오늘 호출하여 나중에 교체할 수 있는 모델을 기반으로 구축할지, 아니면 과제별로 경로를 설정할지를 결정하고 있습니다.
Netics의 입장은 지루한 것이며, 지난 몇 번의 출시 동안 변하지 않았습니다. 호출할 수 있는 모델을 기반으로 구축하고, 그 호출을 인터페이스 뒤에 숨기며, 게이티드 티어(gated tier)를 아키텍처가 아닌 날짜가 지정된 파일럿 결정으로 취급해야 합니다. 프로덕션 워크플로우를 프리뷰 모델에 고정했던 팀들은 이미 올해 두 번이나 그 교훈에 대한 대가를 치렀으며, 비용은 추론(inference) 청구서가 아니었습니다. 그것은 마이그레이션 주말이었습니다.
가격 세부 사항도 같은 취급을 받아야 합니다. 소개 요금제는 임시적인 수치이며, 발표된 도입 후의 입력 토큰당 4달러 및 출력 토큰당 20달러라는 가격이 비즈니스 케이스에 포함되어야 할 것입니다. 만약 어떤 워크플로우가 출시 가격에서만 가치를 반환한다면, 그것은 가치를 반환하지 못하는 것입니다.
출시 후 작성된 Netics의 편집 비교는 다음과 같습니다: 게시된 기능 수치는 모델이 Google의 평가에서 무엇을 하는지 설명하며, 접근(access) 열은 주어진 팀이 실제로 테스트할 수 있는 것을 설명합니다.
이번 주에 팀이 해야 할 일
세 가지 구체적인 조치만 취하면 됩니다. 이 중 어떤 것도 비용이 많이 들지는 않습니다. 첫째, 귀하의 조직(estate) 내에서 장기 호라이즌 모델(long-horizon model)이 눈에 띄게 도움을 줄 수 있는 작업 두세 가지를 선택하십시오. 예를 들어 마이그레이션 평가, 계약서 검토, 패치 백로그 분류 등이 될 수 있습니다. 그리고 공급업체 페이지를 건드리기 전에 통과 기준(pass criteria)을 작성해 두십시오. 둘째, 평가 결과를 저장소(repository)에 보관하여 후보 모델이 항상 동일한 스크립트로 귀하의 데이터에 의해 평가되도록 하십시오. Argon과 그 후속 모델들은 각각 다른 리더보드를 가지고 출시될 것이며, 귀하의 리더보드가 전수되어야 합니다. 셋째, 게이트형 티어(gated tiers)에 대한 관심 등록을 하십시오. 규제 대상 팀이 일반 사용 가능(general availability) 이전에 제한된 모델을 평가할 수 있는 방법이 바로 프로그램 접근(programme access)이기 때문입니다.
만약 모델 레이어(model layer)를 교체 가능하게 유지하고 싶은 경우, 이는 저희가 고객을 위해 구축하는 셀프 호스팅 AI 에이전트 플랫폼의 아키텍처와 같습니다. 루프(loop), 도구(tools), 그리고 평가 세트는 고객 조직 내에 남아 있고, 모델은 구성(configuration)상의 가치입니다. 저희가 이전에 작성한 방어자를 위한 Gemini 3.8 Flash 글에서는 팀이 오늘 배포할 수 있는 동일 계열의 모델에 대해 다루고 있습니다.
Gemini 4 Argon 출시 게시물(blog.google, 2026-09-30, 검색일 2026-10-04)의 공식 Google 차트: 취약점 수정(vulnerability remediation)을 측정하는 CWE-bench v1에서 Argon은 최고 점수인 68%로 공동 1위를 차지했습니다.
솔직하게 말하자면 불편한 트레이드오프가 있습니다. 프론티어급 역량(frontier capability)이 점점 더 게이트 뒤에 도착하고 있으며, 조기 접근 권한을 얻는 팀들은 파트너 관계, 규정 준수 사례(compliance story), 그리고 실행할 준비가 된 평가 스위트(evaluation suite)를 가진 팀들입니다. 이 세 가지를 준비하는 것은 일주일간의 작업이지만, 이러한 모델이 발표될 때마다 보상을 가져다줄 것입니다.
본래는 the Netics blog에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

