2026年8月14日,中国 AI 公司智谱(Z.ai)公布了一个数字:2436。这是从上一代模型 GLM-5.2 起,智谱的模型与国内多支安全团队合作,在 269 个真实软件项目中逐一确认的安全漏洞总数,其中 1097 个属于高危及以上。最老的一个,出自 1981 年写下的代码——那一年,IBM 刚刚推出第一台个人电脑。也就是说,这个漏洞在软件里藏了快 45 年,比许多读者的年龄都大。
一个漏洞藏 45 年,听起来像都市传说,原理却相当朴素。现代软件不是一次写成的,更像老城区的房子:地基是几十年前打的,后人只翻修墙面、加装管道,没人敢动承重结构。操作系统内核、浏览器引擎这类软件,代码量以千万行计——一个浏览器引擎的源码就有几千万行——几十年来被成百上千名程序员轮流改过。老代码圈里有个不成文的规矩:“能跑就别碰”:改坏一处,可能连累全世界依赖它的系统一起崩。于是,那些始终没被触发的缺陷,就一代代传了下来。智谱的统计显示,这批漏洞的平均潜伏期是 26.6 年。2021 年底让全球 IT 部门连夜加班的 Log4j 漏洞事件,同样是藏在依赖库深处多年的老问题——只是那一次,先动手的是黑客。
它一直没被发现,主因是人眼查不完。全球开源软件的代码量以百亿行计,再资深的团队也做不到逐年过一遍。而 AI 找漏洞的方式和人不一样:它不光会”读”代码,还会动手”试”。拿到一份源码后,模型会构造各种刁钻的输入去触发异常——好比检查门锁,不只看锁芯,还要真的拧一下门把手,看门开不开。智谱把”找漏洞”加进了训练科目,让模型练习读代码、找疑点、再验证疑点是否真能被利用。这 2436 个漏洞,分布在操作系统内核、浏览器引擎、开源基础设施、网络协议这些”互联网地基”里——我们每天用手机支付、打车、刷新闻,底层靠的都是它们。
到这里,事情开始偏离设计者的预期。智谱官方博客的原话是:训练时,他们只想让模型更擅长”发现和推理漏洞”。但随着训练量加大,模型不满足于找出孤立的缺陷——它开始跨环节推理,为一条完整的攻击链做规划。通俗地说,从”发现这扇门没锁”,进化到了”推演进门后怎么穿过走廊、撬开第二扇门”。官方用”涌现”形容这件事:官方并没有刻意教它攻击;这项能力是在训练中自己长出来的,而且”比预期来得更快”。能力增长最快的地方,恰是此前最落后的环节——这正是它让安全圈既兴奋又紧张的原因。
图:网络攻防类测试中,GLM-5.3 相比 GLM-5.2 的成绩跳升。来源:z.ai
更反常识的是能力从哪来。GLM-5.3 和 GLM-5.2 用的是同一个基础模型——同一个”大脑”。所有进步,都来自”课后加练”(业内称为后训练):更多真实任务、更长的训练时间、更大的算力投入。官方原话是”我们为 GLM-5.3 做的全部事情,就是扩大后训练规模”。效果相当可观:在衡量”给电脑下命令、独立干活”的 Terminal Bench 3.0 测试中,得分从 4.6 涨到 28.3,约 6 倍;在漏洞利用测试 ExploitBench 中,从 24.4% 涨到 54.4%;自研编程测试整体提升 50%。换句话说,大模型竞争的焦点,正在从”造一个更好的大脑”转向”把同一个大脑练得更熟”。
图:GLM-5.3 与多款模型在编程、攻防、通用任务上的对比成绩。来源:z.ai
加练还带来了一个副作用:同样的成绩,用的”思考量”更少。官方自研测试里,达到同一完成率,GLM-5.3 消耗的推理量比 5.2 少约两成;在”高投入”档位上,它用不到对手一半的思考量,拿到了更高的完成率。对普通用户来说,这意味着同一个模型换来的可能是更快、更省的回答——以及更便宜的调用成本。
图:Z.ai 内部编程测试:同样成绩下,GLM-5.3 消耗的思考量更少。来源:z.ai
在笔者看来,这组数据里最扎眼的是另一个数字:2436 个漏洞中,目前只有 53 个完成修复并公开披露,其余 2383 个仍在保密修复流程中。AI 发现漏洞的速度,已经跑到了人类修复速度的前面,安全团队开始排队,披露流程成了新的瓶颈。换个角度看,这也是进步:过去几十年,这些漏洞连被发现的机会都没有;现在至少进入了修复队列。从公开信息判断,AI 审计对防御方是长期利好,前提是修复与披露的流程跟得上。
智谱没有回避这项能力的另一面:会找漏洞的模型,天然也会利用漏洞。正因如此,官方宣布模型权重推迟两周发布,等安全评估和加固完成。这两周,正是争议最集中的地方。一种观点认为,把能规划攻击链的模型开源,等于把武器发到所有人手里,滥用风险实在;另一种观点则认为,防御方同样急需它——全球开源软件常年缺人审计,AI 是头一回让”给存量代码全面体检”成为可能,堵漏越快,普通用户越安全。还有评论者指出,“开放权重”目前还只是预告:发布当天并没有可下载的模型文件,两周内只有付费接口能用。从社区讨论判断,几种说法各有依据,眼下没有公认的答案。先评估、再开源,算是智谱在两头之间找的一个折中点。
还要说明的是,这项能力不是中国公司独有。在更难的攻击链测试上,闭源模型 Anthropic Fable 5 与 GPT-5.6 Sol 依然领先:六小时限时任务,它们分别完成 247 个和 293 个,GLM-5.3 是 130 个。“AI 越来越会攻击”,是全球前沿模型的共同走向,智谱只是开放权重阵营里追得最紧的一个。能力增长最快的地方,恰恰是差距最大的地方——这句话,放在攻防两端都成立。
参考链接:
- Z.ai 官方博客:GLM-5.3 发布公告《Frontier Coding with Emergent Cyber Capabilities》
- Hacker News 讨论(item?id=49294997)
- Axios:智谱因黑客风险推迟 GLM-5.3 开源
- VentureBeat:GLM-5.3 发布报道(含 Cursor 漏洞)
- Z.ai 安全披露台账(Security Disclosure Ledger)