2026 年 8 月 13 日,距 Gemini 3.6 Flash 发布仅仅过去三周,Google 正式推出 Gemini 3.7 Flash。这款被官方定义为最智能「工作马」(workhorse)的模型,在代码生成与 Agent 自动化指标上实现大幅跃升,价格则降至上一代初始售价的一半。
这次发布标志着 AI 模型的竞争主轴发生转移。大模型竞争焦点正由旗舰模型的绝对能力上限,转向通用实用模型的智能密度与迭代节奏。当强劲的推理能力被注入更低成本、更高吞吐的架构中,计算资源约束下的 Agent 经济学被整体重构。
三周迭代与五折定价:模型竞争转向智能密度
Gemini 3.7 Flash 的初始定价设为每百万 Input Token 0.75 美元,Output Token 3.75 美元,直接将上一代推向市场时的价格削减 50%。底层算法优化与推理工程的改进,让中端模型能够承载此前仅属于顶级旗舰的高阶推理吞吐。
Google 官方表示,本次快速更新直接源于开发者反馈与算法创新。三周的发布窗口打破了以往以半年或年度为单位的更新传统。极短的交付周期表明模型研发已进入标准化工程流水线阶段,模型版本正从稀缺的阶段性产物演变为持续交付的云端服务。
图:Gemini 3.7 Flash 性能与成本对比。来源:Google 官方博客
DeepSWE跃升16%:长程代码重构不再依赖旗舰模型
在关键编码评估中,Gemini 3.7 Flash 的 FrontierCode 1.1 Main 得分从上一代的 34.4% 提升至 43.6%,反映出生产级代码质量的直接进步。更为突出的是 DeepSWE v1.1 表现,解决率从 49.0% 飙升至 65.3%。在涉及多文件上下文与长链条修改的复杂软件工程场景中,中端模型突破了上下文保持与状态跟踪的工程临界点。
前端与网页开发场景同样呈现出显著的性能增长,WebDev Arena Elo 评分提升至 1588 分,生成界面具备更高的设计一致性。开发者只需更少的 Prompt 即可生成功能完整的应用。减少重试次数与手动干预提升了开发体验,更在实际工程流水线中削减了因代码生成失败导致的隐性 API 消耗。
全流程自动化:从文档解析到复杂Agent的算力降维
在知识工作与企业流转评估中,Gemini 3.7 Flash 展现出针对复杂场景的适应力。复杂文档理解的 GDP.pdf 基准得分从 22.0% 提升至 34.0%,AutomationBench 企业工作流自动化得分由 17.0% 增长至 30.4%。非结构化文档结构化提取能力的增强,解除了企业工作流自动化在长文本解析环节的吞吐瓶颈。
面向消费端与企业端的落地生态在发布首日已同步完成接入。订阅 Google AI Pro/Ultra 的 Gemini Spark 个人 Agent 已切换至 3.7 Flash 引擎,Workspace 工具调用执行速度更快;安全层面同步更新 Frontier Safety 护栏,覆盖 CBRN 及网络攻防安全防护。跨生态工具调用成功率的提升,证明高密度中端模型具备在生产环境中接管自动化决策链条的可靠性。
图:Gemini 3.7 Flash 详细 Benchmark 表现总览。来源:Google 官方博客
高频 Agent 的成本奇点:Workhorse 模型吞噬前沿工作负载
开发者可以通过 Gemini API、AI Studio、Android Studio 以及 Gemini Enterprise Agent Platform 无缝调用 3.7 Flash。高频工具调用与自动化编排的 API 门槛下降,使中小型团队部署复杂多 Agent 系统的经济可行性大增。核心推理成本降低 50%,具备连续环境感知与自我修正能力的长程 Agent 系统迎来了算力投入产出比的平衡点。
Gemini 3.7 Flash 的出现证明,前沿工程竞争已从单纯追求智力天花板,转变为将高阶智能以低成本和高速度推向生产一线。当性价比更高的 workhorse 模型不断吞噬原本由旗舰模型垄断的高复杂度任务时,AI 应用开发者的核心优势正从消耗算力的预算规模,转向架构编排与高频调用的执行效率。
参考链接:
- Google Official Blog: Gemini 3.7 Flash Announcement