GEOZ

Gemini 3.6 Flash 降价16%,但 API 废弃了 temperature:开发者如何迁移?

2026/7/23
Gemini 3.6 Flash 降价16%,但 API 废弃了 temperature:开发者如何迁移?

AIAI Summary (BLUF)

本文介绍了Gemini 3.6 Flash和3.5 Flash-Lite模型的新特性、定价、API变更及迁移方法。3.6 Flash在复杂代理和多模态任务上更强且成本更低,3.5 Flash-Lite是3.5系列最快最便宜的模型。两个模型均支持100万token上下文窗口、思考能力和Computer Use工具。开发者需移除弃用的采样参数(temperature/top_p/top_k)并避免以model角色结束请求。

核心洞察

这篇文章最有意思的点是,Google 一口气推了两个定位完全不同的模型:一个主打更强的推理和多模态能力,价格还降了;另一个走极致性价比路线,速度最快、成本最低,专门给高吞吐量场景用。而且 API 有重大变更 —— temperaturetop_p 这些参数被废弃了,迁移的时候得注意。


Gemini 3.6 Flashgemini-3.6-flash)和 Gemini 3.5 Flash-Litegemini-3.5-flash-lite)正式上线,可以用于生产环境了。

Gemini 3.6 Flash 在复杂智能体任务和多模态场景下表现更强,同时 token 用量减少,价格比 3.5 Flash 还便宜。

Gemini 3.5 Flash-Lite 是 3.5 家族里跑得最快、成本最低的模型,高吞吐量场景下比之前版本表现更好。

本文梳理了新模型有哪些变化、API 改动对你代码的影响,以及怎么迁移。

友情提示:你可以用支持 skills 的编码智能体(比如 Antigravity)来自动迁移。运行 /gemini-interactions-api migrate my app to Gemini 3.6 Flash 就行。

核心结论

  1. Gemini 3.6 Flash 输出 token 价格降至 $7.50/百万 token,比 Gemini 3.5 Flash 的 $9.00 降低了 16.7%;输入 token 价格保持

这篇文章最有意思的点是,Google 一口气推了两个定位完全不同的模型:一个主打更强的推理和多模态能力,价格还降了;另一个走极致性价比路线,速度最快、成本最低,专门给高吞吐量场景用。而且 API 有重大变更 —— temperaturetop_p 这些参数被废弃了,迁移的时候得注意。


Gemini 3.6 Flash(gemini-3.6-flash)和 Gemini 3.5 Flash-Lite(gemini-3.5-flash-lite)正式上线,可以用于生产环境了。

Gemini 3.6 Flash 在复杂智能体任务和多模态场景下表现更强,同时 token 用量减少,价格比 3.5 Flash 还便宜。

Gemini 3.5 Flash-Lite 是 3.5 家族里跑得最快、成本最低的模型,高吞吐量场景下比之前版本表现更好。

本文梳理了新模型有哪些变化、API 改动对你代码的影响,以及怎么迁移。

友情提示:你可以用支持 skills 的编码智能体(比如 Antigravity)来自动迁移。运行 /gemini-interactions-api migrate my app to Gemini 3.6 Flash 就行。
.50/百万 token 不变。
2. Gemini 3.5 Flash-Lite 是 3.5 家族中成本最低、速度最快的模型,输入 $0.30/百万 token、输出 $2.50/百万 token,专为高吞吐量场景设计。
3. API 移除三项控制参数:temperature、top_p、top_k 被废弃,未来版本传入会返回 HTTP 400 错误;同时禁止以 model 角色的预填回复结尾,否则返回 400 错误。
4. 两个新模型均支持 100 万 token 上下文窗口、6.4 万 token 最大输出,并内置思考能力与 Computer Use 等原生工具。

新模型一览

模型 模型 ID 默认思考级别 定价 说明
Gemini 3.6 Flash gemini-3.6-flash medium 输入 $1.50/100 万 token,输出 $7.50/100 万 token 在速度与智能之间取得平衡,适合智能体和多模态任务
Gemini 3.5 Flash-Lite gemini-3.5-flash-lite minimal 输入 $0.30/100 万 token,输出 $2.50/100 万 token 3.5 家族里最快、最便宜的模型,适合高吞吐量场景

两个模型都支持 100 万 token 上下文窗口、6.4 万 token 最大输出、思考能力,以及包括 Computer Use 在内的全套内置工具。

完整的规格参数,请看模型页面,价格详情看定价页面。

快速上手

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Write a three.js script that renders an interactive 3D robot."
)

print(interaction.output_text)

Gemini 3.6 Flash 有什么新东西

  • 减少 token 和对话轮次:多步骤工作流比 Gemini 3.5 需要的推理步骤更少、对话轮次更少、工具调用也更少。还能减少执行循环打转的情况。
  • 代码生成质量提升:产出的生产级代码质量更高,不必要的修改和调试循环都减少了。
  • 指令遵循能力更强:诊断任务中,无意义的文件改动少了。
  • 多模态与空间推理更强:图表解读、视觉蓝图转换、多元素网页布局生成都有提升。
  • 倾向于先跑诊断脚本:相比 Gemini 3.5 Flash,它更倾向于在动手改代码之前先跑诊断脚本。复杂任务上更准确,但简单的前端任务上可能会多出探索步骤。
  • 支持 Computer Use:作为原生工具,可用于智能体 UI 自动化。
  • UI 样式偏好:生成功能代码的能力更强,不过人工评测员更喜欢老模型做出来的视觉设计和样式。你可以给明确的设计规范来改善这个问题。
  • 默认思考级别(medium):跟 Gemini 3.5 Flash 一样,默认使用 medium 级别。
  • 降价:输出 token 成本降到 $7.50/100 万(3.5 Flash 是 $9.00),输入 token 保持在 $1.50/100 万。

Gemini 3.5 Flash-Lite 有什么新东西

  • 任务执行延迟更低:批量数据解析和文档提取场景下,吞吐量是 3.5 家族里最高的。
  • 推理和多模态能力增强:从 Gemini 2.5 Flash 迁移过来体验不错。推理任务(HLE 从 11.0% 提到 18.0%)和多模态基准(CharXIV 从 63.7% 提到 74.5%)分数都更高。
  • 子智能体编排与工具可靠性提升:代码执行、搜索和 MCP 工作流中的工具执行可靠性更好。自主规划和复杂子智能体任务建议提高思考级别。
  • 文档理解能力更强:文档解析和结构化数据提取的准确率提升了。根据文档复杂度,可以试试 minimalhigh 两种思考级别。
  • 交互式网页编码与表格数据处理:前端 JavaScript 和表格数据处理表现不错,底层通过轻量级代码执行来规划。
  • 聊天机器人与角色持续性更强:多轮指令遵循和角色一致性优于 Gemini 3.1 Flash-Lite。
  • 支持 Computer Use:作为原生工具,可用于智能体 UI 自动化。

如何挑选合适的 Flash 或 Flash-Lite 模型

下面这张表帮你根据工作负载选择合适的模型和迁移路径。

两个模型都需要移除已废弃的采样参数(temperaturetop_ptop_k)和预填的模型回复。具体见 API 变更部分。

模型 主要使用场景 推荐迁移路径
Gemini 3.6 Flash 代码生成、空间/多模态推理、多步骤智能体工作流 Gemini 3.5 FlashGemini 3 Flash(预览版)Gemini 3.1 Pro
Gemini 3.5 Flash-Lite 自主子智能体执行、高容量数据分析与文档提取、结构化 JSON 解析 Gemini 3.1 Flash-LiteGemini 2.5 Flash

Antigravity 智能体更新

因为性能提升,Gemini 3.6 Flash 现在成了 Gemini Managed Agents 中 Antigravity 智能体的默认模型。你可以在 API 里设置新字段来切换。

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    agent="antigravity-preview-05-2026",
    input="Read Hacker News, summarize the top 10 stories, and save the results as a PDF.",
    environment="remote",
)

print(interaction.output_text)

API 变更与参数更新

从 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 开始,以下 API 变更适用于这两个模型及未来的所有 Gemini 版本。

  • 采样参数废弃temperaturetop_ptop_k 被废弃。API 会忽略这些参数,未来模型版本会直接报错。
  • 预填模型回复校验:不再支持预填模型回复。如果请求中最后一个非空回复是 model 角色,API 会返回 400 错误。

下面详细解释每个变更。

1. 采样参数废弃(temperature、top_p、top_k)

temperaturetop_ptop_k 已被废弃,API 会忽略它们。未来模型版本中,传入这些参数会返回 HTTP 400 错误。请从所有请求中移除这些参数。

# ⚠️ 移除这些参数(已废弃)
generation_config = {
     "temperature": 0.7,
     "top_p": 0.9,
     "top_k": 40,
}

要提高确定性,可以写一条系统指令,明确给规则。

2. 预填模型回复校验 {:#prefilled-model-turn-validation}

如果 API 请求以非空的模型角色回复结尾,现在不允许了,会返回 HTTP 400 错误。

⚠️ 不要这样做

在老的 generateContent 或原始 REST 请求中,以模型角色回复结尾现在不行了:

/* ❌ 不要:请求内容以 'model' 角色回复结尾 */
{
  "contents": [
    {"role": "user", "parts": [{"text": "Translate 'Hello world' to Spanish."}]},
    {"role": "model", "parts": [{"text": "Translation:"}]}  /* ❌ 会报错 */
  ]
}

✅ 推荐迁移方案(Interactions API)

在 Interactions API 中,你不需要手动预填模型回复。如果你的应用以前通过预填模型回复来抑制开场白或强制 JSON 格式,可以用 system_instruction 或结构化输出来代替。

# ✅ 推荐:在 Interactions API 中使用 system_instruction 指定输出格式
interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Translate 'Hello world' to Spanish.",
    system_instruction="Output only the translation without introductory text.",
)

迁移检查清单

再次提醒:你可以用支持 skills 的编码智能体(比如 Antigravity)来自动迁移。运行 /gemini-interactions-api migrate my app to Gemini 3.6 Flash 就行。

迁移到 gemini-3.6-flash

  • 更新模型 ID:把目标模型改成 gemini-3.6-flash
  • 移除已废弃的采样参数
    • 从生成配置中删掉 temperaturetop_ptop_k
    • 用字符串枚举 thinking_level(设为 "medium""high")替换 thinking_budget
    • 去掉 candidate_count(Gemini 3.x 不支持)。
  • 遵守回复校验规则
    • 多轮对话统一用服务端的 previous_interaction_id
    • 不要预填模型回复。
  • 检查函数调用
    • 多模态资产放在响应 payload 里。
    • \n\n 格式化行内指令。
    • 如果遇到 Malformed_Function_Call 错误且与预工具文本有关,看看预工具文本要求的解决文档。
    • 仅在使用 generateContent API 时:确保所有 FunctionResponse 对象包含 call_idname
  • 3.x 基础要求:关于 SDK 更新和思考痕迹保留,参考 Gemini 3.5 迁移检查清单。

迁移到 gemini-3.5-flash-lite

  • 更新模型 ID:把目标模型改成 gemini-3.5-flash-lite
  • 配置思考级别
    • 高容量提取、路由或分类场景:保持 thinking_level"minimal"(默认),吞吐量最大。
    • 自主子智能体带工具调用、代码执行或多步骤推理:把 thinking_level 设为 "medium""high",防止工具提前终止。
  • 移除已废弃的参数并检查函数调用:规则跟 3.6 Flash 一样。
  • 3.x 基础要求:参考 Gemini 3.5 迁移检查清单。

下一步

  • 查看模型概述中的 API 规范
  • 在 Interactions API 指南中了解多智能体编排
  • 去 Google AI Studio 测试和优化提示词
  • 阅读官方博客文章,那里还有 Gemini 3.5 Flash Cyber 模型的信息

常见问题(FAQ)

Gemini 3.6 Flash和3.5 Flash-Lite的主要区别是什么?如何选择?

3.6 Flash适合复杂推理和多模态任务,价格降低;3.5 Flash-Lite是速度最快、成本最低的模型,适合高吞吐量场景。根据任务复杂度选择。

新模型的API有哪些需要特别注意的变更?

temperature、top_p、top_k参数已废弃,请求中需移除;预填模型回复(以model角色结尾)不再支持,否则返回400错误。

Gemini 3.6 Flash相比前代有哪些提升?

token和对话轮次减少,代码质量和指令遵循能力更强,多模态与空间推理提升,支持Computer Use工具,输出token价格降低至$7.50/百万。

Roger深圳
本文由 Roger 审核,最后更新于 2026年7月25日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。