
Gemini 3.6 Flash·3.5 Flash-Lite GA 및 temperature 비권장(Deprecated)화 정리
요약
Google이 Gemini 3.6 Flash 및 3.5 Flash-Lite의 GA를 발표했습니다. 동시에 temperature, top_p, top_k 파라미터가 비권장(Deprecated) 처리되어 기존 코드의 마이그레이션이 필요합니다.
핵심 포인트
- Gemini 3.6 Flash 출시: 응답 간결성 개선 및 토큰 비용 절감
- Gemini 3.5 Flash-Lite GA: 경량 모델로서 멀티 에이전트 서브 태스크에 적합
- 샘플링 파라미터(temperature 등) 비권장화: 향후 Breaking Change 대비 필요
- 개발자 권장 사항: 기존 코드 내 파라미터 사용 현황 전수 조사 및 마이그레이션 준비
2026년 7월 21일, Google은 Gemini API와 관련하여 3가지 중요한 변경 사항을 발표했습니다.
Gemini 3.6 Flash의 일반 제공(GA) 시작 -
Gemini 3.5 Flash-Lite의 일반 제공(GA) 시작 -
샘플링 파라미터(Sampling Parameter) temperature / top_p / top_k의 비권장(Deprecated)화
앞의 두 가지는 새로운 모델 선택지가 늘어나는 긍정적인 뉴스이지만, 세 번째는 기존 코드에 영향을 미칠 수 있는 변경 사항입니다. 특히 temperature 등은 많은 프로덕션(Production) 코드에서 당연하게 사용되고 있는 파라미터이기 때문에, "아직 작동하니까"라며 방치했다가는 향후 갑작스러운 브레이킹 체인지(Breaking Change)로 이어질 수 있습니다.
본 기사에서는 이 세 가지 변경 내용과 개발자가 지금 취해야 할 액션을 정리합니다.
📌 영향을 받는 사람
- Gemini API에서
gemini-3.5-flash나gemini-1.5계열 모델을 본업(Production)에서 이용하고 있는 사람 temperature/top_p/top_k를 명시적으로 지정하여 요청을 보내고 있는 사람- 대량 데이터의 배치(Batch) 처리나, 서브 에이전트(Sub-agent)적인 워크로드(Workload)를 Gemini로 구축하고 있는 사람
이번 세 가지 변경을 모델 라인업의 위치 설정으로서 도식화합니다.
샘플링 파라미터의 비권장화는 특정 모델에 국한된 이야기가 아니라, Gemini API 전체에 관련된 변경 사항이라는 점에 주의하십시오.
gemini-3.6-flash가 안정판·본업 이용 가능한 버전으로 출시되었습니다. 3.x Flash 계열의 최신 버전입니다.
| 항목 | 내용 |
|---|---|
| 모델 ID | gemini-3.6-flash |
| ... |
개발자들로부터 접수되었던 "출력이 지나치게 장황해지는 경향이 있다"라는 피드백에 대응한 점이 특징으로, 동일한 태스크(Task)라도 응답이 더욱 간결해지며 결과적으로 토큰(Token) 비용 절감으로도 이어집니다.
gemini-3.5-flash-lite도 동시에 GA가 되었습니다. 이 모델은 고성능보다는 "가벼움"에 초점을 맞춘 모델입니다.
| 항목 | 내용 |
|---|---|
| 모델 ID | gemini-3.5-flash-lite |
| ... |
멀티 에이전트(Multi-agent) 구성에서 "사령탑 역할을 하는 고성능 모델 + 대량의 서브 태스크를 수행하는 경량 모델"이라는 설계를 할 경우, 이 서브 에이전트 부분에 Flash-Lite를 할당하는 것을 상정하고 있습니다.
temperature, top_p, top_k 세 가지 파라미터가 비권장(Deprecated)으로 선언되었습니다.
⚠️ Breaking Change (장래에)
현시점에서는 즉시 동작이 중단되는 것은 아니지만, 비권장화는 "장래의 삭제"를 염두에 둔 시그널입니다. 특히 이 세 가지는 출력의 랜덤성(Randomness)·다양성을 제어하기 위해 널리 사용되는 파라미터이므로 영향 범위는 클 것으로 생각됩니다.
공식적으로는 이행(Migration) 대상의 상세 내용이 「Latest Gemini Model」 가이드에 기재되어 있다고 합니다만, 적어도 다음 사항은 지금 미리 확인해 두어야 합니다.
- 자신의 코드 어디에서
temperature/top_p/top_k를 지정하고 있는지에 대한 전수 조사(Inventory) - 해당 파라미터들을 사용하는 "목적" (결정적인 출력을 만들고 싶다 / 다양한 출력을 만들고 싶다 등)의 언어화
- 새로운 권장 파라미터·설정 방법으로의 매핑(Mapping)
이행 필요성을 판단하기 위한 플로우차트(Flowchart)입니다.
파라미터 이용 장소 전수 조사: temperature=, top_p=, top_k=로 grep 하는 등의 방식으로 요청 코드를 파악함
모델 업그레이드 검토: gemini-3.5-flash를 사용 중인 경우 gemini-3.6-flash로의 전환을 통해 비용과 토큰 효율 모두를 개선할 가능성이 있음
경량 워크로드 재검토: 배치 처리·서브 에이전트 용도로 고성능 모델을 너무 많이 사용하고 있는 경우, gemini-3.5-flash-lite로 분리하여 비용 절감을 검토함
비권장 파라미터의 이행 방침 결정: 즉시 망가지는 것은 아니므로 서두를 필요는 없지만, 방치하면 향후 일괄 대응의 부담이 커지므로 전수 조사만이라도 조기에 착수함
💡 Tips
모델 전환과 파라미터 이행은 별개의 타이밍으로 진행해도 무방합니다. 우선은 영향이 적은 gemini-3.5-flash-lite
등으로 전환하는 등, 리스크가 낮은 부분부터 착수하는 것을 추천합니다.
import google.generativeai as genai
genai.configure(api_key="YOUR_API_KEY")
model = genai.GenerativeModel("gemini-3.5-flash")
...
import google.generativeai as genai
genai.configure(api_key="YOUR_API_KEY")
# 메인 태스크: 3.6 Flash로 전환 (토큰 효율·코드/계획 능력 향상)
...
핵심은 비권장 (Deprecated) 파라미터를 신규 코드에서 제외하는 것, 그리고 워크로드 (Workload)의 성격에 따라 모델을 구분하여 사용하는 것입니다.
Gemini 3.6 Flash GA. 3.5 Flash보다 저렴하며, 토큰 효율·코드/에이전트 계획 능력이 향상되었고, 불필요하게 긴 출력 (Redundant output) 문제도 해결됨 -
Gemini 3.5 Flash-Lite GA. 낮은 지연 시간 (Low latency)·저비용으로, 대량 자동화나 서브 에이전트 (Sub-agent) 용도에 최적 -
.
즉시 작동이 중단되는 변경은 아니지만, 기존 코드에서 사용 중인 부분을 조기에 점검하고 이행 계획을 세워두어야 할 temperature / top_p / top_k 비권장 (Deprecated)화
새로운 모델의 추가는 환영할 만한 일인 한편, 파라미터의 비권장 (Deprecated)화는 조용히 진행되는 파괴적 변경 (Breaking change)의 입구가 되기 쉽습니다. "작동하고 있으니 괜찮다"가 아니라, 지금 미리 영향 범위를 파악해 두는 것을 추천합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기