Google最便宜的AI跑分全场第一:13秒、1.8美分做出网页

Google最便宜的AI跑分全场第一:13秒、1.8美分做出网页

AIGemini

数据源:HN + web research

2026年9月2日,Google 拿出了六周内的第三个轻量级模型 Gemini 3.8 Flash。它的售价低至每百万输入 token 0.75 美元。在多项核心跑分上,它直接越过了各家重金打造的旗舰产品。全世界最便宜的 AI 和最强悍的 AI,第一次重合在同一个名字上。白菜价的工具已经能跑赢重型设备。高溢价的旗舰产品必须寻找新的存在理由。

六周连发三代,廉价算力挤压溢价空间

距离 3.7 版本发布仅仅过去三周,3.8 Flash 就端上了桌面。它的首发定价保持在底线位置。每百万输入 token 仅需 0.75 美元。输出 token 也只要 3.75 美元。Google 预告 2027 年元旦后价格会翻倍到 1.50 美元。即便如此,它在算力货架上依然是最便宜的那一档。

Gemini 3.8 Flash与旗舰模型跑分对比 图:Gemini 3.8 Flash 在跨领域多步推理(HLE-Verified)中拿到 54.9% 的成绩。来源:Google 官方博客

在极低的价格标签背后,是毫不妥协的工程指标。HLE-Verified 榜单考察跨领域的多步推理能力。3.8 Flash 在这里拿下了 54.9% 的分数。DeepSWE v1.1 专门评估长周期软件工程能力。在这项测试中,它超过了绝大多数体量庞大的旗舰模型。它在垂直领域测试中同样强势。无论是 Vals Finance,还是 Harvey’s Legal 榜单,它都全面压制了其他昂贵竞品。以远低于旗舰的成本跑出了第一梯队的成绩。模型的能力增长曲线正在向低成本端倾斜。

便宜模型之所以能跨级取胜,核心在于底层设计取向的改变。模型在处理复杂逻辑任务时,会主动在后台进行多步推理。它通过迭代调用外部工具,一步步打磨出最终答案。开发者也可以手动调低 effort 参数。这能在容错率高的业务里节省大量 token 消耗。小模型拉长了计算时间,借此填补参数规模的先天劣势。这是当前技术框架下最有效的外挂。

13秒端出互动网页,惊艳画面暗藏静态代码

低廉算力带来的速度优势,在开发者社区转化成了直观的视觉冲击。知名开发者 simonw 进行了现场演示。他只输入了一句简单的 HTML 开发指令。模型耗时 13 秒,花掉区区 1.8 美分,就交出了一个可交互演示程序。

但这远不是完美无缺的工程奇迹。评论区很快有人扒出了它的实际代码。演示页面上醒目的「60 FPS」字样毫无技术含量。它只是模型直接写死在 HTML 结构里的静态文本。实际在浏览器中运行这段代码时,甚至伴随着肉眼可见的卡顿感。廉价算力踏平了生成惊艳画面的门槛。产出代码的底层可靠性依然需要人类工程师逐行审查与重构。

这种便宜快捷与粗糙死板并存的现象,在官方演示中同样存在。官方给出了多个单句指令演示案例。它们极具视觉冲击力,展示了新模型的全能。

演示项目触发指令(Prompt)产出成果
3D 城堡解谜一句话描述场景与材质可玩的 3D 游戏(包含 Nano Banana 生成贴图)
复古导航地图一句话要求复古风格包含真实街景和路线查询的 DOS 版谷歌地图
地形可视化分析一句话导入真实地理数据基于 USGS 数据的可交互地形剖面图
硬件三维拆解一句话描述组件结构Hardware Anatomy 交互式 3D 拆机可视化程序

这些案例展现了充沛算力在创意阶段的狂飙突进。开发软件原型的试错成本被无限压缩。每个人都可以尝试扮演一个全栈产品团队。一次性演示并不能直接上线。想把它们转化为可长期维护的商业级代码,架构层面依然有一条鸿沟要跨。

两小时挖出系统漏洞,廉价算力改变攻防天平

常规开发任务还伴随着代码质量的争议。但在安全特化领域,低成本算力的饱和攻击展示了截然不同的解题思路。Google 同步推出了安全特化版 3.8 Flash Cyber。它走 Fairwind Program 认证体系,专门提供给可信的防御方使用。

云漏洞研究团队用它进行了内部测试。仅仅两个小时,它就找出了一个严重的架构漏洞。这按常理需要人类专家花费数月时间才能定位。它在 CyberGym 漏洞发现测试中达到了前沿水准。跨 20 种编程语言的真实漏洞发现成功率稳定在 70% 以上。

DeepSWE长周期工程跑分表现 图:3.8 Flash 以极低成本在长周期软件工程测试中超越更大模型。来源:Google 官方博客

更关键的是它定位并自动修补漏洞的能力。Chrome 安全团队进行了实测。3.8 Flash Cyber 给出的正确补丁数量,是市面上最大商业模型的 2.6 倍。它在 CWE-Bench 测试中拿到了 47.2% 的成绩。这仅以微弱差距落后于领先旗舰。但它跑完测试的推理成本低了几个数量级。安全防御排查的算力成本降到了极低的地步。这是网络安全猫鼠游戏中少有的系统级解法。

开发效率神话降温,工程团队开始偿还技术债

面对便宜且强大的新工具,社区的反应迅速分裂成两个阵营。在 Hacker News 的前排讨论区,乐观派如 deno 惊呼传统经验被直接打破。新一代轻量模型把便宜、快、好三样优势全占了。用户 ipsod 则感慨良多。Flash 是一条每个月都能让人肉眼可见感受到进化的产品线。

另一边,真正的一线工程团队正在咀嚼低廉算力带来的苦果。用户 rjh29 坦言主观提升并不明显。他甚至发现自己主动翻阅官方文档的次数变少了。更尖锐的声音来自 Forgeties79。他指出身边的工程团队正陷于泥潭。大家正在大量偿还过去盲目引入 AI 写代码留下的技术债。

生成海量代码的成本正在趋近于零。代码仓库熵增的速度直接击穿了人类审查代码的物理极限。 Gemini 3.8 Flash 具备强大的代码生成能力。它用极低的价格进入了每个开发者的编辑器,但传说中的百倍生产力并没有如约而至。

它的意义不在于赢了多少跑分。它证明了当前技术路径下,顶级的推理能力不再强制捆绑高昂的单次请求费用。最低价位档的工具在工程实战中压倒了旗舰产品。AI 行业一直遵循的定价逻辑开始走向解体。新模型用硬实力打碎了旗舰产品的溢价空间。它同时也丢下了一个难题:如何管理海量不稳定的机器生成代码?这个包袱结结实实地砸在了每一个团队负责人的桌面上。

参考链接:

  • Google 官方博客
  • HN 讨论 (item?id=49537553)
  • simonw 实测