2026 年 7 月 21 日,Google 一口气发布了三个新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,可扬眉吐气了,官方照例是"更高效""更聪明""为大规模 AI Agent 而生"。但社区的反应却并不一致,甚至有不少开发者认为这次更新的实际体验和宣传之间存在明显落差。

这篇文章将从技术规格、基准测试、定价策略和社区真实反馈这几个维度,对 Gemini 3.6 Flash 进行一次完整的分析和评论。
Gemini 3.6 Flash 的定位和主要改进
Google 官方给 Gemini 3.6 Flash 的定位是"干活模型"(workhorse),也就是说它不是用来争排行榜第一名的旗舰型号,而是面向日常开发任务和 AI Agent 工作流的主力模型。作为今年 5 月 I/O 大会上发布的 3.5 Flash 的迭代版本,3.6 Flash 在以下几个方面做了改进。
Token 效率提升
Gemini 3.6 Flash 最被 Google 反复提及的改进点是 token 效率。根据 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 减少了约 17% 的输出 token 使用量。在 DeepSWE(由 Datacurve 推出的软件工程基准测试)这类场景下,token 节省幅度甚至达到了 65%。
Google 还表示,模型在执行多步任务时推理步数更少、工具调用频次更低。换句话说,完成相同的工作量,3.6 Flash 的路径更短,计费更少。

价格下调
Gemini 3.6 Flash 的定价为每百万 token 输入 1.5 美元、输出 7.5 美元。对比上一代 3.5 Flash 每百万 token 输出 9 美元的价格,有了约 17% 的降幅。对于需要大规模调用的 AI Agent 任务来说,这个成本差异会在总账单上体现得比较明显。
代码和 Agent 能力
代码能力是 3.6 Flash 主推的升级方向。官方公布的基准数据如下:
| 基准测试 | Gemini 3.5 Flash | Gemini 3.6 Flash | 提升幅度 |
|---|---|---|---|
| DeepSWE | 37% | 49% | +12pp |
| MLE-Bench | 49.7% | 63.9% | +14.2pp |
| OSWorld-Verified(计算机操作) | 78.4% | 83% | +4.6pp |
| GDPval-AA v2(知识工作) | 1349 | 1421 | +72 |
从数据上看,DeepSWE 的提升幅度不小,从 37% 到 49%。MLE-Bench 的增长更明显,接近 14 个百分点。Google 还特别提到,3.6 Flash 生成的代码冗余更少,执行循环更短,更接近生产环境的要求。

计算机操作(Computer Use)也成了 Gemini API 和企业版的内置工具,可以直接调用,不需要额外配置。
知识截止日期更新
还有一个不太起眼但比较实用的更新:Gemini 3.6 Flash 的知识截止日期从 2025 年 1 月推进到了 2026 年 3 月。对于需要模型了解近期事件的应用场景来说,这个更新很有必要。
安全防护升级
安全方面,Google 称 3.6 Flash 上线了升级版的 Frontier Safety 框架,重点强化了对 CBRN(化学、生物、放射性、核)和网络攻击类滥用的防御,同时减少了对正常请求的误拒率。
配角也有亮点:Gemini 3.5 Flash-Lite
这次同步发布的 3.5 Flash-Lite 定位比 3.6 Flash 再低一档,专门针对高吞吐、低延迟的任务场景,比如批量文档处理和 Agent 搜索。
几个关键指标:
-
速度:每秒约 350 个 token,是 3.5 系列中最快的
-
价格:每百万 token 输入 0.3 美元、输出 2.5 美元
-
支持推理档位调节,低配任务用最低档追求速度,复杂子任务可以把思考深度往上调
Flash-Lite 在部分 Agent 和代码任务上的表现出人意料。比如 SWE-Bench Pro 上,Flash-Lite 拿到了 54.2%,而老一代的 Gemini 3 Flash 只有 49.6%。OSWorld-Verified 也是类似的情况,74.0% 对 65.1%。一个定位更低、价格更便宜的模型,在不少任务上反而超过了上一代的正式版,确实有点"以下犯上"的意思。
安全领域的新尝试:Gemini 3.5 Flash Cyber
第三个模型 3.5 Flash Cyber 画风不太一样,专门用于查找和修复代码中的安全漏洞。它基于 3.5 Flash 微调而来,配合 Google 自家的 CodeMender 工具使用。
不过这个模型目前只面向可信合作伙伴做限量内测,普通开发者暂时用不上。Google 给出的理由是漏洞检测能力本身具有两面性,需要先保证防守方有足够的时间来利用,再考虑更大范围的开放。
社区怎么看:争议不小

官方数据看着不错,但社区的反馈却明显分化。
第三方测评的冷水
Artificial Analysis 直接就泼了盆冷水,Gemini 3.6 Flash 的智能指数(Intelligence Index)得分为 50,和 3.5 Flash 完全一样。也就是说,尽管 token 效率提高了、成本降低了,但模型本身的推理和理解能力并没有实质性的进步。
对比同期竞品,3.6 Flash 的智能指数低于 Meta Spark 1.1、GLM-5.2、Sonnet 5、Grok 4.5 等多个模型。有用户在 X(原 Twitter)上直接评价:"分数一模一样,竞品一堆比它强,这升级升了个寂寞。"
性价比的质疑
另一个让开发者不满的点是性价比。有用户指出,Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol Medium 还高,但智能水平反而更低。Flash 系列一直以来的卖点就是性价比,结果在性价比这个核心指标上被竞品反超,处境确实有些尴尬。
作为参照,OpenAI 的 Codex 在同一时间宣布周活跃用户已达 1000 万,并为付费用户发放了新一轮额度。两条消息放在一起看,对比感很强。
实测反馈的落差
也有开发者做了更细致的实际测试。比如用 Google 自家的 Antigravity 来跑 AI 生成游戏任务,结果并不理想,纹理质量反而出现了退化。还有用户反映 3.6 Flash 在中文选词上经常出错、生成的图片和视频质量不稳定、多轮对话中偶尔会出现记忆混乱和工具调用错误等问题。
当然,也有正面的反馈。Hebbia、Harvey、Figma、JetBrains 等企业客户肯定了 3.6 Flash 在文档解析、图表数据分析、报告生成等多模态知识工作中的表现。对于这类结构化任务,3.6 Flash 的效率提升是实打实的。
绕不开的问题:Gemini 3.5 Pro 去哪了?
发了一堆 Flash,社区更关心的问题其实是:旗舰级的 Gemini 3.5 Pro 到底什么时候出?
Google 官方说法是"正在和合作伙伴测试,准备好就上线"。但据彭博社等多家媒体报道,3.5 Pro 的代码生成能力一直没能达到内部预期,6 月份专门更新了一版训练数据来补强代码短板,效果依然不理想。有消息称 Google 甚至推翻了原有训练方案,从头重新训练。
与此同时,Google AI 负责宣传的 Logan Kilpatrick 已经开始将公众注意力引导到 Gemini 4 上,声称 Gemini 4 的预训练已经启动,并且进展让人兴奋。在旗舰模型跳票的背景下,这番表态多少有些"先别急,大的要来了"的意味。
怎么理解这次发布:省成本的路走得通,但智能还欠着
综合来看,Gemini 3.6 Flash 这次发布的逻辑比较清晰:Google 在 token 效率和成本控制上确实做了有效的工作,17% 的 token 节省和对应的降价,对于大规模部署 AI Agent 的企业用户来说有实际价值。
但问题在于,效率的提升没有伴随着智能水平的提高。Artificial Analysis 的智能指数原地不动就是最好的说明。在当前这个竞争激烈的模型市场里,Sonnet 5、GPT-5.6 系列、Grok 4.5 等竞品都在同步甚至更快地推进,单纯靠"更省"已经不足以构成竞争优势。
Flash-Lite 倒是一个值得关注的产品。它在极低价格下展现出了不错的任务完成能力,对于需要大批量处理轻量级任务的场景,是一个实用的选择。
至于 Gemini 3.5 Pro 的缺席和 Gemini 4 的画饼,某种程度上反映了 Google 在前沿模型竞争中面临的压力。能不能在下一代产品上实现真正的突破,可能才是决定 Gemini 系列前途的关键。
模型多了,选择也多了

从这次发布也能看出一个趋势:市场上的模型越来越多,定位越来越细分。Google 自己一口气就出了三个,加上 OpenAI、Anthropic、Meta、DeepSeek 等厂商的产品,开发者面对的选择已经非常繁杂。
不同的任务适合不同的模型,轻量级的用 Flash-Lite,需要深度推理的用 Pro 或旗舰级别,代码任务和知识任务的最优选择也经常不同。实际开发中,频繁切换模型、管理不同厂商的 API Key、处理不同的接口格式,确实是一件麻烦事。
想方便的切换各种模型?用 ServBay AI Gateway。它提供了一个统一的本地端点,支持接近 20 家主流模型服务商,能在一个地方管理所有的 API Key 和模型配置。不管底层用的是 Gemini、Claude、GPT 还是 DeepSeek,工具端只需要指向同一个地址就行,切换模型不用改代码。对于需要在多个模型之间做对比测试或者根据任务类型动态选择模型的开发者来说,能省去不少重复配置的工作;而且一个模型的Token用完了,还能无缝切换另一个,连工作都不需要停的。

写在最后
Gemini 3.6 Flash 交出的这份答卷,优点和短板都很明确。省 token、降成本、缩短 Agent 执行链路,这些改进对企业级批量部署有实在的好处。但智能指数原地踏步、性价比被竞品反超、旗舰 Pro 型号迟迟不到位,这些问题同样摆在台面上,回避不了。
对开发者来说,现阶段更务实的做法可能不是押注某一个模型,而是保持灵活。模型市场正处在快速洗牌期,今天的最优选择三个月后未必还是。与其纠结于某一家的产品路线,不如把精力放在架构层面,确保自己的应用能够低成本地适配不同模型。
Google 把赌注押在了 Gemini 4 上。能不能翻盘,就看下一手牌了。