Gemini 3.6 Flash 降价16%,但 API 废弃了 temperature:开发者如何迁移?
AIAI Summary (BLUF)
本文介绍了Gemini 3.6 Flash和3.5 Flash-Lite模型的新特性、定价、API变更及迁移方法。3.6 Flash在复杂代理和多模态任务上更强且成本更低,3.5 Flash-Lite是3.5系列最快最便宜的模型。两个模型均支持100万token上下文窗口、思考能力和Computer Use工具。开发者需移除弃用的采样参数(temperature/top_p/top_k)并避免以model角色结束请求。
核心洞察
这篇文章最有意思的点是,Google 一口气推了两个定位完全不同的模型:一个主打更强的推理和多模态能力,价格还降了;另一个走极致性价比路线,速度最快、成本最低,专门给高吞吐量场景用。而且 API 有重大变更 —— temperature、top_p 这些参数被废弃了,迁移的时候得注意。
Gemini 3.6 Flash谷歌最新发布的Gemini Flash模型,ID为gemini-3.6-flash,在复杂代理和多模态任务上表现更强,支持思考(中等水平),定价为输入$1.50/1M tokens、输出$7.50/1M tokens。(gemini-3.6-flash)和 Gemini 3.5 Flash-LiteGemini 3.5系列中速度最快、成本最低的模型,ID为gemini-3.5-flash-lite,支持最小思考水平,定价为输入$0.30/1M tokens、输出$2.50/1M tokens。(gemini-3.5-flash-lite)正式上线,可以用于生产环境了。
Gemini 3.6 Flash 在复杂智能体任务和多模态场景下表现更强,同时 token 用量减少,价格比 3.5 Flash 还便宜。
Gemini 3.5 Flash-Lite 是 3.5 家族里跑得最快、成本最低的模型,高吞吐量场景下比之前版本表现更好。
本文梳理了新模型有哪些变化、API 改动对你代码的影响,以及怎么迁移。
友情提示:你可以用支持 skills 的编码智能体(比如 Antigravity)来自动迁移。运行 /gemini-interactions-api migrate my app to Gemini 3.6 Flash 就行。
核心结论
- Gemini 3.6 Flash 输出 token 价格降至 $7.50/百万 token,比 Gemini 3.5 Flash 的 $9.00 降低了 16.7%;输入 token 价格保持
这篇文章最有意思的点是,Google 一口气推了两个定位完全不同的模型:一个主打更强的推理和多模态能力,价格还降了;另一个走极致性价比路线,速度最快、成本最低,专门给高吞吐量场景用。而且 API 有重大变更 —— temperature、top_p 这些参数被废弃了,迁移的时候得注意。
Gemini 3.6 Flash(gemini-3.6-flash)和 Gemini 3.5 Flash-Lite(gemini-3.5-flash-lite)正式上线,可以用于生产环境了。
Gemini 3.6 Flash 在复杂智能体任务和多模态场景下表现更强,同时 token 用量减少,价格比 3.5 Flash 还便宜。
Gemini 3.5 Flash-Lite 是 3.5 家族里跑得最快、成本最低的模型,高吞吐量场景下比之前版本表现更好。
本文梳理了新模型有哪些变化、API 改动对你代码的影响,以及怎么迁移。
友情提示:你可以用支持 skills 的编码智能体(比如 Antigravity)来自动迁移。运行 /gemini-interactions-api migrate my app to Gemini 3.6 Flash 就行。
.50/百万 token 不变。
2. Gemini 3.5 Flash-Lite 是 3.5 家族中成本最低、速度最快的模型,输入 $0.30/百万 token、输出 $2.50/百万 token,专为高吞吐量场景设计。
3. API 移除三项控制参数:temperature、top_p、top_k 被废弃,未来版本传入会返回 HTTP 400 错误;同时禁止以 model 角色的预填回复结尾,否则返回 400 错误。
4. 两个新模型均支持 100 万 token 上下文窗口、6.4 万 token 最大输出,并内置思考能力与 Computer Use一种原生工具能力,允许模型代理化地控制用户界面进行自动化操作,如点击、输入等。 等原生工具。
新模型一览
| 模型 | 模型 ID | 默认思考级别 | 定价 | 说明 |
|---|---|---|---|---|
| Gemini 3.6 Flash | gemini-3.6-flash |
medium |
输入 $1.50/100 万 token,输出 $7.50/100 万 token | 在速度与智能之间取得平衡,适合智能体和多模态任务 |
| Gemini 3.5 Flash-Lite | gemini-3.5-flash-lite |
minimal |
输入 $0.30/100 万 token,输出 $2.50/100 万 token | 3.5 家族里最快、最便宜的模型,适合高吞吐量场景 |
两个模型都支持 100 万 token 上下文窗口、6.4 万 token 最大输出、思考能力,以及包括 Computer Use 在内的全套内置工具。
完整的规格参数,请看模型页面,价格详情看定价页面。
快速上手
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Write a three.js script that renders an interactive 3D robot."
)
print(interaction.output_text)
Gemini 3.6 Flash 有什么新东西
- 减少 token 和对话轮次:多步骤工作流比 Gemini 3.5 需要的推理步骤更少、对话轮次更少、工具调用也更少。还能减少执行循环打转的情况。
- 代码生成质量提升:产出的生产级代码质量更高,不必要的修改和调试循环都减少了。
- 指令遵循能力更强:诊断任务中,无意义的文件改动少了。
- 多模态与空间推理更强:图表解读、视觉蓝图转换、多元素网页布局生成都有提升。
- 倾向于先跑诊断脚本:相比 Gemini 3.5 Flash,它更倾向于在动手改代码之前先跑诊断脚本。复杂任务上更准确,但简单的前端任务上可能会多出探索步骤。
- 支持 Computer Use:作为原生工具,可用于智能体 UI 自动化。
- UI 样式偏好:生成功能代码的能力更强,不过人工评测员更喜欢老模型做出来的视觉设计和样式。你可以给明确的设计规范来改善这个问题。
- 默认思考级别(medium):跟 Gemini 3.5 Flash 一样,默认使用
medium级别。 - 降价:输出 token 成本降到 $7.50/100 万(3.5 Flash 是 $9.00),输入 token 保持在 $1.50/100 万。
Gemini 3.5 Flash-Lite 有什么新东西
- 任务执行延迟更低:批量数据解析和文档提取场景下,吞吐量是 3.5 家族里最高的。
- 推理和多模态能力增强:从 Gemini 2.5 Flash 迁移过来体验不错。推理任务(HLE 从 11.0% 提到 18.0%)和多模态基准(CharXIV 从 63.7% 提到 74.5%)分数都更高。
- 子智能体编排与工具可靠性提升:代码执行、搜索和 MCP 工作流中的工具执行可靠性更好。自主规划和复杂子智能体任务建议提高思考级别。
- 文档理解能力更强:文档解析和结构化数据提取的准确率提升了。根据文档复杂度,可以试试
minimal和high两种思考级别。 - 交互式网页编码与表格数据处理:前端 JavaScript 和表格数据处理表现不错,底层通过轻量级代码执行来规划。
- 聊天机器人与角色持续性更强:多轮指令遵循和角色一致性优于 Gemini 3.1 Flash-Lite。
- 支持 Computer Use:作为原生工具,可用于智能体 UI 自动化。
如何挑选合适的 Flash 或 Flash-Lite 模型
下面这张表帮你根据工作负载选择合适的模型和迁移路径。
两个模型都需要移除已废弃的采样参数(temperature、top_p、top_k)和预填的模型回复。具体见 API 变更部分。
| 模型 | 主要使用场景 | 推荐迁移路径 |
|---|---|---|
| Gemini 3.6 Flash | 代码生成、空间/多模态推理、多步骤智能体工作流 | Gemini 3.5 Flash、Gemini 3 Flash(预览版) 或 Gemini 3.1 Pro |
| Gemini 3.5 Flash-Lite | 自主子智能体执行、高容量数据分析与文档提取、结构化 JSON 解析 | Gemini 3.1 Flash-Lite 或 Gemini 2.5 Flash |
Antigravity 智能体更新
因为性能提升,Gemini 3.6 Flash 现在成了 Gemini Managed Agents 中 Antigravity 智能体的默认模型。你可以在 API 里设置新字段来切换。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
agent="antigravity-preview-05-2026",
input="Read Hacker News, summarize the top 10 stories, and save the results as a PDF.",
environment="remote",
)
print(interaction.output_text)
API 变更与参数更新
从 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 开始,以下 API 变更适用于这两个模型及未来的所有 Gemini 版本。
- 采样参数废弃:
temperature、top_p和top_k被废弃。API 会忽略这些参数,未来模型版本会直接报错。 - 预填模型回复校验:不再支持预填模型回复。如果请求中最后一个非空回复是
model角色,API 会返回 400 错误。
下面详细解释每个变更。
1. 采样参数废弃(temperature、top_p、top_k)
temperature、top_p 和 top_k 已被废弃,API 会忽略它们。未来模型版本中,传入这些参数会返回 HTTP 400 错误。请从所有请求中移除这些参数。
# ⚠️ 移除这些参数(已废弃)
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
要提高确定性,可以写一条系统指令,明确给规则。
2. 预填模型回复校验 {:#prefilled-model-turn-validation}
如果 API 请求以非空的模型角色回复结尾,现在不允许了,会返回 HTTP 400 错误。
⚠️ 不要这样做
在老的 generateContent 或原始 REST 请求中,以模型角色回复结尾现在不行了:
/* ❌ 不要:请求内容以 'model' 角色回复结尾 */
{
"contents": [
{"role": "user", "parts": [{"text": "Translate 'Hello world' to Spanish."}]},
{"role": "model", "parts": [{"text": "Translation:"}]} /* ❌ 会报错 */
]
}
✅ 推荐迁移方案(Interactions API)
在 Interactions API 中,你不需要手动预填模型回复。如果你的应用以前通过预填模型回复来抑制开场白或强制 JSON 格式,可以用 system_instruction 或结构化输出来代替。
# ✅ 推荐:在 Interactions API 中使用 system_instruction 指定输出格式
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Translate 'Hello world' to Spanish.",
system_instruction="Output only the translation without introductory text.",
)
迁移检查清单
再次提醒:你可以用支持 skills 的编码智能体(比如 Antigravity)来自动迁移。运行 /gemini-interactions-api migrate my app to Gemini 3.6 Flash 就行。
迁移到 gemini-3.6-flash
- 更新模型 ID:把目标模型改成
gemini-3.6-flash。 - 移除已废弃的采样参数:
- 从生成配置中删掉
temperature、top_p和top_k。 - 用字符串枚举
thinking_level(设为"medium"或"high")替换thinking_budget。 - 去掉
candidate_count(Gemini 3.x 不支持)。
- 从生成配置中删掉
- 遵守回复校验规则:
- 多轮对话统一用服务端的
previous_interaction_id。 - 不要预填模型回复。
- 多轮对话统一用服务端的
- 检查函数调用:
- 多模态资产放在响应 payload 里。
- 用
\n\n格式化行内指令。 - 如果遇到
Malformed_Function_Call错误且与预工具文本有关,看看预工具文本要求的解决文档。 - 仅在使用 generateContent API 时:确保所有
FunctionResponse对象包含call_id和name。
- 3.x 基础要求:关于 SDK 更新和思考痕迹保留,参考 Gemini 3.5 迁移检查清单。
迁移到 gemini-3.5-flash-lite
- 更新模型 ID:把目标模型改成
gemini-3.5-flash-lite。 - 配置思考级别:
- 高容量提取、路由或分类场景:保持
thinking_level为"minimal"(默认),吞吐量最大。 - 自主子智能体带工具调用、代码执行或多步骤推理:把
thinking_level设为"medium"或"high",防止工具提前终止。
- 高容量提取、路由或分类场景:保持
- 移除已废弃的参数并检查函数调用:规则跟 3.6 Flash 一样。
- 3.x 基础要求:参考 Gemini 3.5 迁移检查清单。
下一步
- 查看模型概述中的 API 规范
- 在 Interactions API 指南中了解多智能体编排
- 去 Google AI Studio 测试和优化提示词
- 阅读官方博客文章,那里还有 Gemini 3.5 Flash Cyber 模型的信息
常见问题(FAQ)
Gemini 3.6 Flash和3.5 Flash-Lite的主要区别是什么?如何选择?
3.6 Flash适合复杂推理和多模态任务,价格降低;3.5 Flash-Lite是速度最快、成本最低的模型,适合高吞吐量场景。根据任务复杂度选择。
新模型的API有哪些需要特别注意的变更?
temperature、top_p、top_k参数已废弃,请求中需移除;预填模型回复(以model角色结尾)不再支持,否则返回400错误。
Gemini 3.6 Flash相比前代有哪些提升?
token和对话轮次减少,代码质量和指令遵循能力更强,多模态与空间推理提升,支持Computer Use工具,输出token价格降低至$7.50/百万。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



