Gemini 4 Argon: 새로운 기능, 비용 및 전환 고려 사항
요약
Google DeepMind가 Gemini 4 Argon을 출시하며 지식 작업 및 긴 컨텍스트 처리 능력을 강조했습니다. 이 모델은 18개 벤치마크 중 다수에서 우위를 점했으며, 출력 제한이 최대 1M 토큰으로 대폭 증가했습니다. 초기 비용 구조와 함께 기업의 전환 고려 사항에 초점을 맞추고 있습니다.
핵심 포인트
- Argon은 지식 작업 및 긴 컨텍스트 처리 능력이 강점입니다.
- 출력 제한이 기존 64K에서 최대 1M 토큰으로 확장되었습니다.
- 초기 비용은 입력 $2/백만, 출력 $10/백만으로 책정됩니다.
- 소프트웨어 취약점 탐지 및 패치에 특화되어 있습니다.
Google DeepMind가 최근 큰 벤치마크 표와 소수의 게스트 리스트를 가지고 Gemini 4 Argon을 출시했습니다. Google 자체 수치에 따르면 Opus 5.5, Fable 5.1, GPT-6 Astra와 비교한 18개 테스트 중 13개에서 승리하거나 동률을 기록했습니다. 하지만 현재는 사이버 디펜더 그룹에게만 공개되어 있습니다.
따라서 유용한 질문은 이것이 최고의 모델인가가 아닙니다. 전환하기 전에 무엇을 확인해야 하는지, 그리고 실제로 비용이 얼마나 들 것인지입니다. 지금까지 알려진 내용은 다음과 같습니다.
요약 (TL;DR)
- Argon은 Google의 표에서 18개 벤치마크 중 13개에서 승리하거나 동률을 기록했으며, 주로 지식 작업(knowledge work), 긴 컨텍스트(long context), DeepSWE 분야입니다. FrontierSWE와 Terminal-bench에서는 낮은 성적을 보였습니다.
- 출력 제한이 64K 토큰에서 1M 토큰으로 증가했습니다. 또한 독립적인 테스트 한 건에서 GPT-6 Astra의 27k 토큰 대비 작업당 62k 토큰이라는 많은 양을 작성합니다.
- 초기 가격은 입력 토큰 백만 개당 $2, 출력 토큰 백만 개당 $10입니다. 이후에는 각각 $4와 $20으로 두 배가 됩니다.
Gemini 4 Argon이란 무엇인가?
Argon은 Google의 새로운 플래그십 모델입니다. 7개월여 만에 Flash 티어를 넘어선 첫 Gemini이며, 지난 5월 I/O에서 Google이 예고했으나 출시되지 않은 Gemini 3.5 Pro를 대체합니다.
Google은 이를 장기적이고 다단계적인 작업(multi-step work)을 위해 구축했습니다: 실제 소프트웨어 엔지니어링, 법률 및 금융과 같은 기업 지식 작업, 그리고 사이버 방어입니다. 개발자에게 두 가지 세부 사항이 눈에 띕니다. 출력 제한이 기존의 64K에서 1M 토큰으로 증가했다는 점과, 자체적으로 소프트웨어 취약점을 찾고, 검증하고, 패치하도록 훈련되었다는 점입니다.
다른 모델과의 차이점
이전 버전에 비해 가장 큰 변화는 1M 토큰 출력 제한과 사이버 트레이닝(cyber training)입니다. Google에 따르면 Argon은 이전 보안 중심 모델이었던 Gemini 3.8 Flash Cyber보다 명확하게 발전했습니다.
다른 분야의 모델들과 비교했을 때, Google 자체 표에 나타난 패턴은 읽기 쉽습니다. Argon은 지식 작업(knowledge work), 긴 컨텍스트(long context), 그리고 DeepSWE에서 앞섭니다. 다른 모델들은 쉘-앤-터미널 벤치마크를 유지하고 있습니다.
| Model | Leads on (in Google's table) | Reading |
|---|---|---|
| Gemini 4 Argon | Vals Index, AutomationBench, Vals Finance Agent v2, Harvey's Legal Agent, DeepSWE, Vibe Code Bench, RiemannBench, both GraphWalks tests, Agent's Last Exam, Chartography, LVBench | 문서 중심의 장문 컨텍스트 작업에서 최고 성능 |
| ... | ||
| On cybersecurity 분야에서는 Argon과 GPT-6 Astra가 CWE-bench v1에서 68%로 동률입니다. |
중립적인 검증을 위해 Artificial Analysis에 따르면 Argon은 Intelligence Index에서 GPT-6 Astra와 동등하며, GPT-6.1 Sol보다 1점 앞서 있습니다.
테스트 점수 (The test scores)
이 수치들을 최고 사례(best cases)로 간주하세요. 이들은 주로 Google 자체 실행을 기반으로 한 선택된 벤치마크이며, The New Stack에서 표로 정리했습니다.
이 점수들을 읽을 때 주의할 점 세 가지가 있습니다.
첫째, 몇몇 우위는 미미합니다. Vals Index와 Vibe Code Bench에서 격차는 2점 미만입니다. Vibe Code Bench의 경우 네 모델 모두 89% 이상을 기록했기 때문에 실질적으로 동률에 가깝습니다.
둘째, 하네스(harness)가 중요합니다. CWE-bench v1에서는 OpenAI와 Anthropic 모델이 각각 자체 에이전트 하네스인 Codex와 Claude Code를 사용하여 실행되었으므로, 이 점수는 모델과 툴링(tooling)을 합친 결과입니다. 또한 Artificial Analysis는 Terminal Bench 4를 별도로 실행하여 Argon이 57%를 기록했고, 이는 Claude Sonnet 5.5 (64%), Opus 5.5 (60%), GPT-6 Astra (59%)에 뒤처진 수치입니다.
셋째, 가장 큰 격차는 지식 작업과 긴 컨텍스트에서 나타납니다. 법률 관련 결과가 Fable 5.1 옆에서는 매우 크게 보이지만, 여전히 19.6%라는 것은 다섯 개 중 약 한 개의 작업만 완료된다는 의미입니다.
실제로 비용이 얼마나 들까 (What it will really cost you)
토큰당 가격은 비교하기에 적절하지 않은 수치입니다. Artificial Analysis는 작업(task)당 비용을 측정하며, Argon의 장황함(chattiness)이 바로 여기서 드러납니다.
| 시나리오 | Intelligence Index 작업당 비용 |
|---|---|
| Gemini 4 Argon, 출시 가격 ($2 입력, $10 출력) | $1.99 |
| ... | |
| 첫 번째 행과 마지막 행은 Artificial Analysis의 수치입니다. 중간 행은 제가 측정한 것입니다. 출시 할인은 50% 프로모션이므로, 만약 Argon이 동일한 토큰 수를 계속 사용한다면 가격을 두 배로 올리면 비용도 두 배가 됩니다. Astra의 가격 또한 변경될 수 있으니, 해당 행은 예측보다는 대략적인 가이드로 간주하십시오. |
몇 가지 다른 기준점(anchors)들이 있습니다. Opus 5.5는 Argon의 출시 후 요율과 동일한 백만 출력 토큰당 $20을 부과합니다. GPT-6.1 Sol의 새로 할인된 가격은 Argon의 출시 가격과 일치합니다. 최대 용량으로 사용되는 1M 토큰 응답 비용은 현재 $10이고 나중에는 $20이 됩니다. 캐시된 입력 토큰은 입력 가격에서 95% 할인을 받으므로, 동일한 레포지토리 크기의 프롬프트를 다시 전송할 경우 도움이 될 것입니다.
전환 전에 확인할 사항들
Google의 발표나 관련 기사에서 마이그레이션 노트(migration notes)를 찾지 못했기 때문에, 이것은 깨지는 변경사항(breaking changes)에 대한 변경 로그가 아닙니다. 출시 세부 정보가 시사하는 바에 대한 체크리스트입니다.
- 아직 전환할 수 없습니다. 접근이 제한적이며, 이 모델은 Fairwind 참가자와 Google 자체 팀에게만 사이버 가드레일(cyber guardrails) 없이 배포됩니다. Google은 광범위한 출시 전에 여전히 안전장치를 조정하고 있으므로, 보안 관련 프롬프트는 나중에 접근 권한을 얻게 되면 다르게 작동할 수 있습니다.
- 출력 설정을 재검토하십시오. 제한이 64K에서 1M 토큰으로 증가했습니다. 만약 최대 출력을 제한하거나(cap max output), 시간 초과를 설정하거나, 크기 제한이 있는 곳으로 스트리밍하는 경우, 이러한 선택들은 64K를 기준으로 이루어졌습니다. 기본값이 아닌 의도적으로 상한선을 높여야 합니다.
- 더 장황한 모델을 예상하십시오. Artificial Analysis는 Argon이 작업당 62 K의 출력 토큰을 측정했으며, 이는 최대 노력으로 GPT-6 Astra가 측정한 27 K와 비교됩니다. 품질뿐만 아니라 지연 시간(latency)과 청구서도 확인하십시오.
- 가격 변화를 계획하십시오. 백만 토큰당 $2와 $10은 입문 요율입니다. 이는 $4와 $20으로 변경될 것입니다.
Google이 이 모델로 구축한 것들
아래 내용은 Google의 자체 발표에서 가져온 것이며 내부 사용 사례를 설명합니다. 벤치마크가 아닌 데모 영상처럼 읽어주세요.
- C/C++를 Rust로 마이그레이션. Argon 에이전트는 re2나 libgav1 같은 라이브러리에서 수만 줄의 코드부터 Fuchsia Zircon 커널의 800K+ 라인에 이르기까지 Google 전반에 걸쳐 코드를 포팅하고 있습니다. Google은 이러한 재작성 작업들이 프로덕션 배포 전에 자동 및 수동 감사, 에뮬레이션 테스트, 검토를 거치고 있다고 말합니다.
- libgav1. 기존 Rust 포트를 기반으로 에이전트가 32K 라인의 SIMD 코드를 컴파일러가 자체적으로 벡터화하는 안전한(safe) Rust로 대체했습니다. Google에 따르면 이 메모리 안전 비디오 디코더는 동일한 비디오 출력을 내면서도 포트보다 2.7배 빠르게 작동합니다.
- 데이터 센터 메모리. 에이전트 팀은 전체 규모의 프로파일링 데이터를 분석하고 메모리 최적화를 적용하여, 배포 후 300 TiB 이상을 확보했습니다. Google은 총 500 TiB에서 1 PiB에 이를 것으로 추정합니다.
- 양자 컴퓨팅 (Quantum). Argon은 단일 서브루틴의 큐비트당 게이트 비용(qubits-times-gates cost) 측면에서 발표된 기준선보다 40% 더 나은 성능을 몇 분 만에 달성했습니다.
- 보안 (Security). Google이 지난 3월 인수한 Wiz는 Argon을 Scan for Good 프로그램에 사용하고 있습니다. Google에 따르면, 이 프로그램을 통해 전 세계 병원에서 사용하는 의료 소프트웨어에서 기존의 최신 모델들이 놓쳤던 심각한 결함을 발견했다고 합니다.
libgav1 사례가 가장 주목할 만합니다. 그 과정은 프로파일링(profile) → 실험 실행 → 컴파일러가 생성한 결과 읽기 → 여러 차례 반복하는 것입니다. 오늘날 어떤 역량 있는 모델로든 이 루프를 돌릴 수 있습니다. Google의 주장은 Argon이 흐름을 잃지 않고 계속 유지된다는 것입니다.
여전히 부족한 부분 (Where it still loses)
이는 출시 발표에서 건너뛴 부분입니다.
여전히 부족한 부분 (Where it still loses)
이는 출시 발표에서 건너뛴 부분입니다.
- FrontierSWE v2. Argon은 55.0%로 GPT-6 Astra의 65.5%에 미치지 못하며, 네 모델 중 가장 마지막 순위입니다.
- Terminal-bench 4.0. Opus 5.5가 66.4%로 앞서며, Argon은 57.4%를 기록해 9%p의 격차를 보였습니다.
- 기타 에이전트 및 과학 테스트. Astra는 Terminal-Bench Science 0.1 (68.1% 대 57.6%)과 OSWorld-2.0 (72.6% 대 69.2%)에서 Argon보다 우수하며, Opus 5.5는 PostTrainBench (49.3% 대 45.3%)에서 Argon을 앞섭니다.
- 사이버 보안 비교. Google은 자체 취약점 벤치마크에서 Gemini 3.8 Flash Cyber와 85.8% 대 71.0%로, Wiz의 침투 테스트 벤치마크에서는 70.9% 대 58.2%로 보안 결과를 비교했습니다. 이는 순위라기보다는 진전을 보여주는 것입니다.
- 독립적인 테스트. Google 외부에서 직접 사용해 본 사람은 매우 적습니다. Bloomberg는 출시 전 보도에서 일부 Google 내부자들이 Argon이 Anthropic 및 OpenAI 모델만큼 강력하지 않다고 우려한다고 보도했습니다. Google은 이를 부인하며 직원들이 몇 주 동안 버전을 테스트해 왔다고 밝혔습니다.
- 작업당 비용. 출시 할인이 끝난 후에는 Argon이 저렴한 옵션이 아닐 수 있습니다 (위 참조).
또 하나의 미결 사항입니다. Google의 게시물에서는 컨텍스트 윈도우(context window)를 명시하지 않았으며, 한 매체는 2M 토큰을 보도했습니다. 저는 공식 문서를 기다릴 것입니다.
마무리하며 (Wrapping up)
Argon은 작업이 길고 문서 중심인 분야, 즉 금융, 법률, 자동화, 대용량 입력 및 대용량 출력이 필요한 영역에서 가장 강력해 보입니다. 반면, GPT-6 Astra와 Opus 5.5가 Google 자체 표에서도 여전히 선두를 차지하는 셸 기반 에이전트 작업에서는 약한 모습을 보였습니다.
공개 벤치마크들 역시 서로 의견이 다릅니다. DeepSWE는 한 가지를 말하고, FrontierSWE와 Terminal-bench는 또 다른 것을 말합니다. 그러므로 헤드라인에 나온 수치 하나만 보고 판단하지 마십시오. 여러분의 레포지토리에서 실제 티켓 약 20개를 뽑아 오늘 사용하는 도구로 실행해보고, 접근 권한이 생기면 Argon으로도 실행해보세요.
그렇게 하실 때 두 가지를 기록하십시오: 작업당 비용과 긴 출력이 끝까지 여전히 일관성이 있는지 여부입니다. 이 두 가지는 아직 독립적으로 확인된 바가 없습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
