Gemini 3.5 Flash 출시 — 언제 사용해야 하고 언제 사용하지 말아야 하는가
요약
Google이 I/O 2026에서 가성비 모델인 Gemini 3.5 Flash를 출시했습니다. 이 모델은 에이전트 및 코딩 벤치마크에서 Gemini 3.1 Pro를 능가하는 성능을 보여주며, 특히 도구 호출과 의사결정 분야에서 강점을 가집니다.
핵심 포인트
- Gemini 3.5 Flash는 코딩(Terminal-Bench 2.1) 및 도구 호출(MCP Atlas) 벤치마크에서 이전 Pro 모델보다 높은 성능을 기록함
- 1M 입력 컨텍스트와 동적 사고(Dynamic Thinking) 기능을 지원하며, 텍스트, 이미지, 오디오, 비디오 등 멀티모달 입력을 처리함
- 에이전트의 도구 순차 호출에는 적합하지만, 화면 제어(Computer Use) 기능은 지원하지 않아 브라우저 조작 시에는 GPT-5.5가 더 유리함
- EvoLink와 같은 통합 게이트웨이를 사용하면 모델 ID 교체만으로 Gemini, Claude, GPT 모델 간의 전환이 용이함
Google은 오늘 I/O 2026에서 Gemini 3.5 Flash를 출시했습니다. 이 "가성비" 모델은 이제 에이전트 (Agent) 및 코딩 벤치마크에서 Gemini 3.1 Pro를 능가합니다. 전환 여부를 결정하기 위해 실제로 알아야 할 내용은 다음과 같습니다.
빠른 사양
모델 ID: gemini-3.5-flash
컨텍스트 (Context): 1M 입력 / 65K 출력
입력: 텍스트, 이미지, 오디오, 비디오, PDF
가격: 입력 100만 토큰당 $1.50, 출력 100만 토큰당 $9.00, 캐시된 입력 100만 토큰당 $0.15
지식 컷오프 (Knowledge cutoff): 2026년 1월
동적 사고 (Dynamic Thinking): 기본적으로 활성화 (중간), 낮은 모드 사용 가능
Flash가 승리하는 부분
| 벤치마크 | Flash | 3.1 Pro 격차 |
|---|---|---|
| Terminal-Bench 2.1 (코딩) | 76.2% | 70.3% (+5.9) |
| MCP Atlas (도구 호출/Tool calling) | 83.6% | 78.2% (+5.4) |
| Finance Agent v2 | 57.9% | 43.0% (+14.9) |
| GDPval-AA (의사결정/Decision-making) | 1,656 Elo | 1,314 Elo (+342) |
| CharXiv Reasoning | 84.2% | — |
Flash가 승리하지 못하는 부분
- Humanity's Last Exam: 3.1 Pro가 앞섬 (44.4% vs 40.2%)
- ARC-AGI-2: 3.1 Pro가 앞섬 (77.1% vs 72.1%)
- SWE-Bench Pro: Claude Opus 4.7이 여전히 선두
- 컴퓨터 사용 (Computer Use): GPT-5.5만이 프로덕션 환경의 화면 제어 기능을 갖춘 유일한 모델입니다. Flash는 이를 지원하지 않습니다.
도구 기능 (Tool capabilities)
출시된 기능: 함수 호출 (Function Calling), 구조화된 출력 (Structured Output), 도구로서의 검색 (Search-as-a-tool), 코드 실행 (Code Execution)
누락된 기능: 컴퓨터 사용 (Computer Use) — 화면 제어, 클릭, 양식 채우기 불가. 에이전트가 브라우저나 데스크톱 앱을 조작해야 한다면, 해당 부분에는 여전히 GPT-5.5가 필요합니다.
어떤 모델을 선택해야 하는가
- 에이전트가 여러 도구를 순차적으로 호출해야 합니까? → Gemini 3.5 Flash
- 에이전트가 대규모 리포지토리 (Repo) 전체의 코드를 리팩토링해야 합니까? → Claude Opus 4.7
- 에이전트가 브라우저나 데스크톱을 제어해야 합니까? → GPT-5.5
작업에 따라 세 가지 모두가 필요합니까?
→ 통합 게이트웨이 API 호출 예시: EvoLink를 통한 라우팅 (Gemini, Claude, GPT를 위한 단일 엔드포인트):
curl -X POST https://direct.evolink.ai/v1beta/models/gemini-3.5-flash:generateContent
-H "Authorization: Bearer YOUR_EVOLINK_KEY"
-H "Content-Type: application/json"
-d '{ "contents": [{ "role": "user", "parts": [{"text": "List the top 3 files changed in the last commit and explain what each change does"}] }] }'
EvoLink를 통해 이전의 Gemini 모델을 사용하고 있었다면, 모델 ID(model ID)만 교체하면 됩니다. 다른 변경 사항은 필요하지 않습니다. 이점은 Flash, Opus 4.7, GPT-5.5에 대해 동일한 API 키와 엔드포인트를 사용할 수 있다는 것입니다. 작업에 따라 모델 ID를 전환하십시오. 하나의 청구서, 자동 장애 조치 (failover).
전체 문서: EvoLink Gemini 3.5 Flash API 가이드
주의 사항
이것들은 Google의 벤치마크 (benchmarks)입니다. 독립적인 커뮤니티 테스트가 이를 확인하거나 조정할 것입니다. 일반적인 벤치마크에 대한 회의론을 가지고 정확한 수치를 받아들이십시오.
에이전트 비용 (Agent cost)은 단위 비용 (unit cost)이 아닙니다. 20단계의 에이전트 루프 (agent loop)는 20번의 API 호출을 의미합니다. 토큰 (token)당 빠르고 저렴한 것이 워크플로 실행 (workflow run)당 저렴한 것과 같지는 않습니다.
동적 사고 (Dynamic Thinking)는 추론 토큰 (reasoning tokens)을 추가합니다. 모델은 답변하기 전에 생각합니다. 이는 출력 품질을 높이지만 출력 토큰 수(output token count)도 증가시킵니다. 청구서를 주의 깊게 확인하십시오.
3.5 Pro는 다음 달에 출시될 예정입니다. Google로부터 최고의 범용 추론 (general reasoning) 능력이 필요하다면 기다릴 가치가 있을 수 있습니다.
출처
Google I/O 2026
Gemini 3.5 Flash 벤치마크 및 가격 분석
EvoLink API 문서
계층 (tier)이 아니라 작업 (task)에 따라 모델을 선택하십시오. 도구 오케스트레이션 (tool orchestration)에는 Flash를, 코드 재작성 (code rewrites)에는 Opus를, 화면 제어 (screen control)에는 GPT를 사용하십시오. 이것이 현재의 상황입니다.
tags: gemini, ai-agents, llm, api, google-io
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기