不换大脑暴涨50%:国产AI挖出2436个漏洞紧急刹车

不换大脑暴涨50%:国产AI挖出2436个漏洞紧急刹车

AI国产大模型

数据源:Z.ai 官方博客 + IT之家 + HN

不换大脑,纯靠补习班拿第一

2026年8月14日,智谱正式发布编程大模型 GLM-5.3。这款模型在综合编程体验上较前代提升了 50%,所有增益全部来自后训练(Post-Training)阶段的规模化扩展,底层基座大模型未做任何更换。

在以往的技术路线中,模型性能要想取得代际突破,通常依赖于海量算力堆叠出更大的基座参数。 GLM-5.3 却选择了一条截然不同的工程路径:与上一代 GLM-5.2 共用同一个基座大脑,将训练精力集中在数十倍复杂度的长程任务环境、更丰富的模拟场景以及长达数月的强化学习调优上。这种不换大脑纯靠后训练的策略,证明了国产大模型在底层算力受限的客观条件下,依然可以通过高精度的工程练兵找到务实的追赶路径。

实测数据验证了这种补习班策略的惊人威力。在考察复杂命令行交互的 Terminal Bench 3.0 基准测试中,GLM-5.3 的得分从 GLM-5.2 的 4.6 分爆发式跃升至 28.3 分;在难度极高的 DeepSWE v1.1 编程基准中,其成绩也从 46.2 分提高到 66.9 分。这表明模型在长序列代码重构与环境部署中摸到了闭源前沿的门槛,后训练的边界远比行业此前预想的更加宽广。

为了支撑这种高强度的训练,智谱同步开源了后训练框架 slime,配合长程任务强化学习算法 SAO 与显存优化技术 IndexShare,将强化学习训练吞吐量提升了 2.3 倍以上。在硬件供给存在天花板的现实背景下,提高每一卡算力的吞吐效率正成为大模型竞赛真正的胜负手。

GLM-5.3 与多模型基准对比总表 图:GLM-5.3 与全球主流模型在编程与安全基准上的对比总表。来源:Z.ai 官方博客

用三分之一的废话,解出同样的难题

在大模型落地企业级生产力的过程中,高昂的 Token 消耗成本始终是阻碍规模化应用的主要山头。 GLM-5.3 在设计上展现出极强的工程功利主义,省略繁复的思维链展示,专注于寻找解题的最短路径。

测试数据清晰地反映了这种路线差异:在 High 运行档位下,GLM-5.3 取得了 31.4% 的准确率,平均每个任务仅输出约 5 万个 Token;作为对比,竞争对手 Claude Opus 4.8 取得 29.5% 准确率却需要消耗 12 万个 Token。这意味着 GLM-5.3 用不到对方一半的输出长度实现了更高的解题成功率,直接把云端推理的带宽与计算成本缩减了六成。

即使切换到极限性能的 Max 档位,GLM-5.3 依然交出了 34.5% 准确率与 7.5 万 Token 的成绩单,相比前代 GLM-5.2 消耗 9.6 万 Token 仅换来 23.4% 准确率的表现实现了质的飞越。尽管 Anthropic 的 Fable 5 仍以 39.5% 的准确率保持领先,但 GLM-5.3 在长文本处理上提供了 1M Token 的上下文窗口与 128K 的最大单次输出,且强制开启深度思考模式(thinking 不可禁用)。这种将思考逻辑深度绑定的机制,避免了用户因误关深度思考而导致复杂逻辑崩塌的问题。

目前,智谱已将该模型整合进 ZCode、AutoClaw 以及 GLM Coding Plan 计费方案中,并在非高峰时段推出 5 折优惠,同时 Trae、扣子、Qoder 和 CodeBuddy 等主流平台也已完成首批接入。对于开发者生态而言,极致的 Token 效率叠加灵活的算力调度,将大幅降低代码自动化工具在日常研发流水线中的部署门槛。

Z.ai Code Bench 性能与 token 效率对比图 图:Z.ai Code Bench 性能与 token 效率对比图。来源:Z.ai 官方博客

45年前的防线漏洞,被AI两小时攻破

让人意外的是,当智谱为了提升代码生成能力而将模型推入极具深度的环境强化训练时,GLM-5.3 却在网络安全领域展现出了野蛮生长的涌现能力。编写高质量代码与拆解软件漏洞在工程机制上逻辑同源,模型在理解代码运行轨迹的同时自然掌握了寻找系统缺陷的方法。

在衡量网络安全能力的专业基准 CyberGym 中,GLM-5.3 以 84.5% 的得分摘得开源模型桂冠,超越了 Mythos 5(83.8%)与 GPT-5.6 Sol(83.6%);在 ExploitBench 上,其得分从前代的 24.4% 暴增至 54.4%;而在 ExploitGym 测试中,GLM-5.3 仅用 2 小时就完成了 105 个漏洞利用任务,相比 GLM-5.2 同期完成的 29 个提升了近四倍。这组令人震撼的数据证明,自动化攻防已经从理论概念蜕变为具备现实威胁的高效工具。

在与国内多家安全团队的实操合作中,GLM-5.3 深入 269 个主流开源项目,一口气挖出了 2,436 个真实隐患,其中包含 107 个严重漏洞与 990 个高危漏洞。让人后背发凉的是,其中最古老的一个漏洞早在 1981 年就被引入了代码库,在开源社区的眼皮底下隐蔽潜伏了整整 45 年,所有发现漏洞的平均潜伏时间长达 26.6 年。当人类审计人员数十年来未能察觉的死角被 AI 批量揭开,传统的软件供应链安全防御体系面临着前所未有的重塑压力。

网络安全能力评估图 图:GLM-5.3 在网络安全攻防测试环境中的表现评估。来源:Z.ai 官方博客

攻击太快,防守方不得不按住发布键

这种超出预期的漏洞挖掘破坏力,迅速将研发团队推入了两难困境。AI 拥有的双重用途属性在此刻被无限放大——同样的逻辑能力,既能用于修复软件漏洞,也能被恶性攻击者用来自动化制造零日漏洞攻击。

面对潜在的网络安全风险,智谱做出了一项罕见的决策:推迟开源权重与 API 上线的节奏。目前挖掘出的 2,436 个漏洞中,仅有 53 个已完成公开披露,其余 2,383 个仍处于严格的保密修复期,模型权重被暂缓两周开源,API 接口也采取分阶段逐步放开的策略。官方明确表示需要完成必要的安全加固,在保留 AI 防守价值的同时尽可能限制潜在的攻击能力,这标志着 AI 能力演化第一次因为安全过载而主动踩下刹车。

回顾此前背景,智谱首席科学家唐杰早在 6 月 29 日就在社交平台 X 上公开征集 GLM-5.3 的功能建议,而近期国内大模型社区的发布节奏更是空前密集,Qwen3.8 与 DeepSeek V4 Pro 等前沿模型接连出击。在竞争白热化的大模型赛道中,智谱选择宁可牺牲发布速度也要扣留权重的做法,客观上为行业树立了安全合规高于技术出海的红线标杆。

算力天花板下的追赶范式

GLM-5.3 的发布展现了国产大模型在艰难环境下的破局智慧。笔者观察到,在无法轻易扩张前沿预训练算力的当下,通过精细化后训练与长程任务强化学习,工程团队依然能够将既有基座的潜力发掘至极致,在特定生产力场景中摸到全球顶级模型的门框。

然而,当模型的代码理解力无意间突破了安全临界点,技术的竞赛维度便不再局限于榜单上的分数。如何在释放自动化编程红利的同时,防止 AI 化身不可控的攻防利器,已成为所有顶尖团队必须面对的课题。

GLM-5.3 探索出了一条依靠后训练规模化实现弯道超车的可行路径。当能力演化的车轮越跑越快,主动踩下刹车防范风险,才能保证大模型在生产力场景中稳健行稳致远。


参考链接:

  • Z.ai 官方博客
  • IT之家
  • 科技日报
  • HN 讨论 (item?id=49353407)