砸穿行业底价前,先通关政府安全审查
2026 年 9 月 30 日,Google 发布了定位于前沿智能新阶段的 Gemini 4 Argon。科技巨头推出新一代大模型,首发动作往往是向全世界开发者广发 API 密钥。但 Google 首席 AI 架构师 Koray Kavukcuoglu 在发布会上宣布的第一个动作,是主动把最强模型送进美国政府的预发布访问流程。它没有立刻出现在大众开发者的账单里,第一批拿到它的,是 Fairwind 计划中的受信任网络防御方。
在限制访问权限的同时,Google 却抛出了一个异常廉价的算力价目表:介绍期内输入每百万 token 只要 2 美元,输出 10 美元。有效利用缓存机制还能再打九五折。即便等到介绍期结束价格恢复,这也牢牢钉在了当下前沿模型最便宜的那一档。低廉价格带来的算力平权,与严格审查代表的安全红线,在这里形成了剧烈的反差。
把阶段性开放和预发布评审跟廉价账单写在同一段落里,这本身就是一个清晰的信号。大模型的发布不再是一场单纯的算力零售游戏,它变成了一场复杂的合规性通关。先把最锐利的矛交给防御方进行压力测试,确认它不会刺穿现有系统防线后,再考虑下放给普通企业。商业变现的急迫性在安全红线面前,罕见地做出了让步。
80万行内核代码让机器重写
Google 之所以要先把它交给防御方,是因为新模型的输出能力限制被直接解除了。过去受限于内存和计算资源的压力,模型单次生成的长度往往卡在几万 token,而 Gemini 4 Argon 将单次输出上限直接拔高到了 100 万 token。这并非简单的参数堆砌,而是为了让机器有足够的舞台连续生成几十万字。由此它可以独立跑完一个极度长程的推理与执行循环。
为了证明这种长程任务的稳定性,Google 组建了一支 Argon 智能体团队,直接拿自家的核心代码库当作实战靶场。这支团队接手了一场规模浩大的语言迁徙:要把老旧的 C 和 C++ 代码库改写成内存安全的 Rust 语言。如果只是几万行的 re2 或者 libgav1 核心库,人类工程师熬夜加班还能勉强应对。但面对 Fuchsia Zircon 超过 80 万行的内核代码,这种容错率极低的重构任务已经超出了人类团队的常规承受极限。
在这样的工程管线里,人类开发者的角色发生了根本性的转换。程序员不再盯着屏幕逐行敲击键盘,大家退居二线,负责搭建仿真测试环境并死死盯着审计环节的红绿灯。机器包揽了所有的生成与重构工作,人类只负责最后的风险验收。当输出额度不再是工程瓶颈,大型软件系统重构的成本结构就产生了本质改变,能不知疲倦重写 80 万行安全代码的机器,同样有能力生成 80 万行的恶意负载。
图:Google 官方发布页头图。来源:Google Blog
几分钟抹平专家耗费三年的优化周期
在更底层的硬件性能压榨上,新模型表现出了让人不安的系统控制力。以 libgav1 视频解码器为例,Argon 智能体接管了人类工程师刚写了一半的 Rust 移植版本。它没有使用粗暴的词汇替换,而是基于性能分析数据引导(profile-guided),在多轮反复实验中精准替换了多达 3 万 2 千行 SIMD 代码。它不仅理解了底层硬件的调用逻辑,还产出了对现代编译器非常友好的安全 Rust 语句。
这一番代码重写的成果是惊人的:触发自动向量化后的新版本,比原来人类写的 Rust 代码快了整整 2.7 倍,且最终的输出丝毫不差。同样的算力优势也表现在量子计算领域。面对量子研究者耗费数年心血优化的子程序,机器只花了几分钟时间,就帮他们把时空资源消耗压降了 40%。这直接掀翻了已发表顶级论文里的性能基准线,在模型眼里,令人头疼的物理约束不过是另一种高维空间的参数寻优。
甚至连整个数据中心的底层遥测数据,也成了机器的狩猎场。一组 Argon 智能体日夜不停地分析服务器机队的运行特征,自主从海量日志中发现内存分配缺陷并直接推送系统级的优化指令。到目前为止,它们已经从 Google 的服务器里抠出了超过 300 TiB 的闲置内存。按工程团队预测这项优化最终能省下 500 TiB 到 1 PiB 的空间,这种不眠不休的底层压榨是顶尖人类团队都无法支撑的劳动强度。
机器拿下榜单首位,开发者抗议强制压缩
如果只看冷冰冰的自动化测试成绩,Argon 在多个维度展现出了绝对的基准线统治力。在衡量长期软件工程任务解决率的 DeepSWE v1.1 测试中,它拿到了 77.9% 的罕见高分,在评估端到端业务执行能力的 AutomationBench 中以 51.3% 的成绩占据第一。面对长视频理解任务 LVBench,高达 91.7% 的准确率同样傲视群雄。这台机器甚至在按照对美国 GDP 贡献加权计算的 Vals Index 经济影响评估中成功登顶。
第三方独立评测机构 Artificial Analysis 专门为它的 High 版本拉出了详尽的分档与价格对照表,在客观维度上给予了背书。但这并不代表开发者在实操中对它毫无怨言。在 Hacker News 的讨论区里,根本没有人在乎那些破纪录的跑分,所有人都在为产品侧的系统控制权吵得不可开交。最大的争议爆发在上下文窗口的自动压缩机制上,API 接口明明大方地给足了 100 万上下文容量,但在直接面向用户的产品端,只要输入超过 25 万 token,系统就会强制替用户执行压缩逻辑且不提供任何关闭开关。
有开发者直接退订了 Ultra 服务,他们就是为了逃离这种被官方强制绑定的交互框架。还有人为了夺回对机器的控制流,干脆在 NixOS 操作系统上用 agy 配合 3.8 Flash 自己搭建底层运行环境。这种系统级控制权争夺战反映了一个真实现状。底层能力越强大,开发者对失去控制权的恐慌与反弹就越剧烈。
图:发布页的能力对照表图表。来源:Google Blog
商业变现排在国家安全防线之后
回顾过去两年大模型领域的激烈交锋,主流叙事永远是参数突破紧跟着光速降价,随后便是呼吁所有创业者把业务系统接入新发布的 API。但这一次,Gemini 4 Argon 把产品发布活生生切割成了两半。摆在明面上的一半,是低到足以洗牌整个行业定价体系的调用价格。而藏在暗处的另一半,则是高到难以企及的安全审查门槛。
它在 Google 内部的实战案例,已经证明了机器在几十万行代码级别进行破坏与重构的惊人潜力。当一台机器可以在几分钟内重写底层的内存调度逻辑,或者分析全量遥测数据找出系统漏洞时,情况就不同了。把它毫无防护地接入公共互联网,无异于给每一个网络节点发配了一名全天候的自动化爆破手。传统那种在内部沙盒里测两天就匆匆上线的粗放时代,已经从事实上终结了。
最强 AI 的发放顺序在今天被正式改写,Google 把它优先交给网络安全防御方并主动进入政府审查流程。这印证了前沿模型的商业逻辑,已经从先卖再管变成了先审再放。普通开发者和企业客户排在国家安全与漏洞评估之后。这正是因为这根长矛实在太锋利,持盾的人必须先学会怎么挡。
参考链接:
- Google Blog 发布公告
- Hacker News 讨论