更少 token、更高分:Gemini 3.6 Flash 把企业 AI 的账算明白了

更少 token、更高分:Gemini 3.6 Flash 把企业 AI 的账算明白了

GeminiGoogleAIEnterpriseLLMAgent

数据源:web research

企业选大模型,早就不只是问「谁更聪明」了。

真正的问题是:每花一块钱,能完成多少任务?Google 在 7 月 21 日连发三款 Gemini 新模型——3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber——最显眼的变化是,「成本效率」这件事被摆到了台面上。

三款模型,三个分工

模型定位核心卖点适用场景
Gemini 3.6 Flash主力工作模型输出 token 降 17%,关键 benchmark 分数提升,输出价格更低编码、知识工作、多模态 agent
Gemini 3.5 Flash-Lite极速轻量模型350 tokens/s 输出速度,同代最低成本高并发、低延迟、规模化 agent
Gemini 3.5 Flash Cyber网络安全专用安全漏洞发现与修复,限量提供给政府与可信伙伴代码安全、红队、合规审查

3.6 Flash 是 3.5 Flash 的继任者,直接接管 Gemini app 和 API 里的主力位置。3.5 Flash-Lite 负责把成本压到更低,同时保持够用的速度。3.5 Flash Cyber 则走专用路线,绑定 Google DeepMind 的 CodeMender agent 做限量试点。Google 没有发布 3.5 Pro,反而预告了 Gemini 4 的训练已经启动——这条产品线的节奏很清晰:先把「便宜、快、够用」做到极致,再往上推能力天花板。

3.6 Flash:用更少的 token,拿更高的分

Google 对 3.6 Flash 的强调集中在四个字:token 效率。根据 Artificial Analysis 的独立评测,3.6 Flash 在 Intelligence Index 上的输出 token 比 3.5 Flash 少了 17%。在 Datacurve 的 DeepSWE 任务中,输出 token 的节省幅度甚至高达 65%。

省 token 不是文字游戏。输出 token 越少,意味着:

  • 同样的任务,API 账单更小;
  • 多步 agent 工作流里,循环调用次数更少;
  • 端到端延迟更低,用户体验更稳。

3.6 Flash 在减少输出的同时,分数反而上去了:

Benchmark3.6 Flash3.5 Flash变化
DeepSWE(代码编辑)49.0%37.0%+12.0%
MLE Bench(ML 研究)63.9%49.7%+14.2%
OSWorld-Verified(计算机使用)83.0%78.4%+4.6%
GDPval-AA v2(知识工作)14211349+72

这组数据最值得关注的点是「效率提升」和「能力提升」同时发生。通常企业做模型升级,要先问一个灵魂问题:新模型能不能在更快、更便宜的同时,不牺牲质量?3.6 Flash 给出的答案是:可以。

成本账:输出价格降了,缓存也更便宜

3.6 Flash 的定价是 $1.50/1M 输入 token、$7.50/1M 输出 token。对比 3.5 Flash 的 $1.50/$9.00,输入不变,输出降价 17%。这和 17% 的输出 token 节省叠加起来,实际任务成本会下降得比表面数字更明显。

模型输入 / 1M tokens输出 / 1M tokens速度(tokens/s)缓存命中 / 1M tokens
Gemini 3.6 Flash$1.50$7.50303.6$0.15
Gemini 3.5 Flash$1.50$9.00
Gemini 3.5 Flash-Lite$0.30$2.50350

数据来源:Artificial Analysis Index,2026 年 7 月。

3.5 Flash-Lite 的定价更低到 $0.30/$2.50,速度标到 350 tokens/s。这个价位已经接近上一代 3.1 Flash-Lite 的廉价区间,但能力又往上提了一档。对于需要高并发、对绝对推理能力要求不那么极致的场景,它的 ROI 非常直接。

缓存命中价 $0.15/1M 也是个容易被忽略的点。企业 agent 往往要反复塞进同一份上下文——文档、代码库、产品手册。3.6 Flash 的缓存价格只相当于正常输入的 10%,长期跑下来的成本优势会进一步放大。

企业该怎么看这件事?

大模型选型正在从「追求最强」转向「匹配任务」。3.6 Flash 的发布把这个趋势变得更具体:

  • 编码和 agent 工作流:DeepSWE 和 OSWorld-Verified 的分数提升,说明它有能力承担实际的生产任务,而不是只能做简单问答。
  • 知识密集型工作:GDPval-AA 的提高,加上 Hebbia、Harvey 等客户反馈的多模态文档解析能力,意味着它在法律、金融、研究这类场景里可以承担更多重活。
  • 预算敏感的大规模部署:3.5 Flash-Lite 提供了一个更便宜的高速选项,适合把 agent 铺到更多用户、更多流程里。

Google 的产品策略也很清楚:先让企业把 AI 跑起来、跑得起,再谈下一代的极限能力。3.5 Pro 的延迟和 Gemini 4 的远景,都是这条路上的后续步骤。对正在做 AI 预算的企业来说,眼前的选择反而更简单了——不需要等一个完美的旗舰模型,而是用一个「够快、够省、还涨了分」的工作模型把项目推进。

结语

Gemini 3.6 Flash 没有宣布革命性的新架构,但它做对了一件更务实的事:把企业最关心的成本、速度和效果放在同一张表上,并且让它们同时改善。当输出 token 变少、输出价格变低、关键 benchmark 分数变高的时候,AI 部署的 ROI 计算就不再是「为了效果能烧多少钱」,而是「每块钱能完成多少事」。

这个转变,比任何单一分数都更值得企业注意。

参考链接:

  • Google 官方博客:Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
  • Ars Technica:Google announces Gemini 3.6 Flash and cybersecurity AI
  • TechCrunch:Google releases three new Gemini models
  • Artificial Analysis:Gemini 3.6 Flash Intelligence, Performance & Price Analysis