企业选大模型,早就不只是问「谁更聪明」了。
真正的问题是:每花一块钱,能完成多少任务?Google 在 7 月 21 日连发三款 Gemini 新模型——3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber——最显眼的变化是,「成本效率」这件事被摆到了台面上。
三款模型,三个分工
| 模型 | 定位 | 核心卖点 | 适用场景 |
|---|---|---|---|
| Gemini 3.6 Flash | 主力工作模型 | 输出 token 降 17%,关键 benchmark 分数提升,输出价格更低 | 编码、知识工作、多模态 agent |
| Gemini 3.5 Flash-Lite | 极速轻量模型 | 350 tokens/s 输出速度,同代最低成本 | 高并发、低延迟、规模化 agent |
| Gemini 3.5 Flash Cyber | 网络安全专用 | 安全漏洞发现与修复,限量提供给政府与可信伙伴 | 代码安全、红队、合规审查 |
3.6 Flash 是 3.5 Flash 的继任者,直接接管 Gemini app 和 API 里的主力位置。3.5 Flash-Lite 负责把成本压到更低,同时保持够用的速度。3.5 Flash Cyber 则走专用路线,绑定 Google DeepMind 的 CodeMender agent 做限量试点。Google 没有发布 3.5 Pro,反而预告了 Gemini 4 的训练已经启动——这条产品线的节奏很清晰:先把「便宜、快、够用」做到极致,再往上推能力天花板。
3.6 Flash:用更少的 token,拿更高的分
Google 对 3.6 Flash 的强调集中在四个字:token 效率。根据 Artificial Analysis 的独立评测,3.6 Flash 在 Intelligence Index 上的输出 token 比 3.5 Flash 少了 17%。在 Datacurve 的 DeepSWE 任务中,输出 token 的节省幅度甚至高达 65%。
省 token 不是文字游戏。输出 token 越少,意味着:
- 同样的任务,API 账单更小;
- 多步 agent 工作流里,循环调用次数更少;
- 端到端延迟更低,用户体验更稳。
3.6 Flash 在减少输出的同时,分数反而上去了:
| Benchmark | 3.6 Flash | 3.5 Flash | 变化 |
|---|---|---|---|
| DeepSWE(代码编辑) | 49.0% | 37.0% | +12.0% |
| MLE Bench(ML 研究) | 63.9% | 49.7% | +14.2% |
| OSWorld-Verified(计算机使用) | 83.0% | 78.4% | +4.6% |
| GDPval-AA v2(知识工作) | 1421 | 1349 | +72 |
这组数据最值得关注的点是「效率提升」和「能力提升」同时发生。通常企业做模型升级,要先问一个灵魂问题:新模型能不能在更快、更便宜的同时,不牺牲质量?3.6 Flash 给出的答案是:可以。
成本账:输出价格降了,缓存也更便宜
3.6 Flash 的定价是 $1.50/1M 输入 token、$7.50/1M 输出 token。对比 3.5 Flash 的 $1.50/$9.00,输入不变,输出降价 17%。这和 17% 的输出 token 节省叠加起来,实际任务成本会下降得比表面数字更明显。
| 模型 | 输入 / 1M tokens | 输出 / 1M tokens | 速度(tokens/s) | 缓存命中 / 1M tokens |
|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 303.6 | $0.15 |
| Gemini 3.5 Flash | $1.50 | $9.00 | — | — |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 350 | — |
数据来源:Artificial Analysis Index,2026 年 7 月。
3.5 Flash-Lite 的定价更低到 $0.30/$2.50,速度标到 350 tokens/s。这个价位已经接近上一代 3.1 Flash-Lite 的廉价区间,但能力又往上提了一档。对于需要高并发、对绝对推理能力要求不那么极致的场景,它的 ROI 非常直接。
缓存命中价 $0.15/1M 也是个容易被忽略的点。企业 agent 往往要反复塞进同一份上下文——文档、代码库、产品手册。3.6 Flash 的缓存价格只相当于正常输入的 10%,长期跑下来的成本优势会进一步放大。
企业该怎么看这件事?
大模型选型正在从「追求最强」转向「匹配任务」。3.6 Flash 的发布把这个趋势变得更具体:
- 编码和 agent 工作流:DeepSWE 和 OSWorld-Verified 的分数提升,说明它有能力承担实际的生产任务,而不是只能做简单问答。
- 知识密集型工作:GDPval-AA 的提高,加上 Hebbia、Harvey 等客户反馈的多模态文档解析能力,意味着它在法律、金融、研究这类场景里可以承担更多重活。
- 预算敏感的大规模部署:3.5 Flash-Lite 提供了一个更便宜的高速选项,适合把 agent 铺到更多用户、更多流程里。
Google 的产品策略也很清楚:先让企业把 AI 跑起来、跑得起,再谈下一代的极限能力。3.5 Pro 的延迟和 Gemini 4 的远景,都是这条路上的后续步骤。对正在做 AI 预算的企业来说,眼前的选择反而更简单了——不需要等一个完美的旗舰模型,而是用一个「够快、够省、还涨了分」的工作模型把项目推进。
结语
Gemini 3.6 Flash 没有宣布革命性的新架构,但它做对了一件更务实的事:把企业最关心的成本、速度和效果放在同一张表上,并且让它们同时改善。当输出 token 变少、输出价格变低、关键 benchmark 分数变高的时候,AI 部署的 ROI 计算就不再是「为了效果能烧多少钱」,而是「每块钱能完成多少事」。
这个转变,比任何单一分数都更值得企业注意。
参考链接:
- Google 官方博客:Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
- Ars Technica:Google announces Gemini 3.6 Flash and cybersecurity AI
- TechCrunch:Google releases three new Gemini models
- Artificial Analysis:Gemini 3.6 Flash Intelligence, Performance & Price Analysis