预训练架构零变动,后训练榨出50%编程增量
8 月 14 日,智谱正式发布 GLM-5.3。前一天晚上 DeepSeek 刚在开源社区掀起一轮狂欢,智谱这手来得不声不响,但官方给出的技术公告只有一句冷冰冰的概括:基座模型与前代 GLM-5.2 完全一致,所有能力突破均来自后训练(Post-training)阶段的扩展。原话是「Scaling post-training is all we did for GLM-5.3」——GLM-5.3 我们只做了一件事,把后训练继续往大里做。
这种纯粹依赖后训练的策略,在多个关键编程基准测试中带来了显著的性能表现。智谱自建私有评测 Z.ai Code Bench 显示,新模型整体编程能力较前代提升了 50%。在公开基准 Terminal-Bench 3.0 中,得分从 GLM-5.2 的 4.6 跃升至 28.3。这表明模型在命令行工具链与系统级交互的综合调度能力上,完成了从基础可用向复杂实战的跨越。
在衡量真实代码库 Bug 修复能力的 DeepSWE v1.1 评测中,GLM-5.3 的得分由 46.2 提高到 66.9,与 Claude Fable 5 的 69.7 及 Kimi K3 的 67.5 差距缩小至 0.6 分。这意味着开源模型在复杂工程场景中,具备了与顶尖闭源模型正面抗衡的实战水平。在考察终端智能体长路径决策的 Agents’ Last Exam(ALE-CLI)测试中,GLM-5.3 取得 28.5 分,超越了 Fable 5 的 23.8 分,并紧贴 GPT-5.6 Sol 的 28.6 分。
在覆盖 44 种职业场景的 GDPval-AA v2 综合评测中,GLM-5.3 拿到 1769 分位居全球第一,高于 Fable 5 的 1743 分。这说明模型在跨行业任务理解与综合工作流规划上拥有广泛的适应性。在 Terminal-Bench 3.0 与 ALE-CLI 两项开源权重模型榜单中,GLM-5.3 均登顶前沿 SOTA(State of the Art)位置。
图:GLM-5.3 官方基准评测对比。来源:z.ai/blog/glm-5.3
5万 Token 打平 12万:算力压榨背后的环境合成管线
在评测分数提升的同时,GLM-5.3 呈现出极高的 Token 消耗效率。官方披露的 Z.ai Code Bench 效率数据显示,在 High 难度测试中,GLM-5.3 凭借 5 万输出 token 实现了 31.4% 的任务解决率,而 Claude Opus 4.8 达成 29.5% 的解决率则消耗了 12 万 token。同等任务下节省过半算力开销,直接改善了长程推理的经济性。
在 Max 难度下,GLM-5.3 消耗 7.5 万 token 取得 34.5% 解决率,优于 GLM-5.2 消耗 9.6 万 token 获得的 23.4%。尽管 Claude Fable 5 在该项测试中仍以 39.5% 的解决率领先,但 GLM-5.3 证明了通过后训练可以大幅优化模型推理时的思维链路径。这种算力压榨能力来自于智谱全新构建的后训练技术栈。
图:Z.ai Code Bench 任务解决率与 Token 消耗效率。来源:z.ai/blog/glm-5.3
智谱在后训练架构中引入了三项核心工程突破:用于长上下文优化调度的 IndexShare 架构、带压缩机制的长程任务 RL(Reinforcement Learning,强化学习)算法 SAO,以及大规模异步训练框架 slime。SAO 算法的压缩机制能够保持长路径推理中的收益持续累积,避免模型在多步骤探索中出现注意力衰减或陷入无意义的循环。
支撑这一训练体系的底座,是智谱搭建的自动化环境合成管线。首先由研究智能体从真实大厂工程实践中收集复杂任务模式,合成出带有多步依赖与隐藏状态的可执行长程环境。随后由评判智能体验证环境的可解性,再由验证器在无参考解的条件下生成验证标准,并通过求解轨迹识别并关闭奖励捷径。
这些合成环境复刻了大厂资深工程师的真实工作场景,涵盖计算集群管理、分布式存储调度、内部文档检索与大型代码库重构。模型需要在复杂的 ML(Machine Learning,机器学习)基础设施任务中独立诊断性能瓶颈、编写优化代码、运行基准测试并交付可测量的加速结果。部分训练任务的工程复杂程度,相当于资深工程师数天的工作量。
挖出2436个深层漏洞:当大模型开始构筑完整利用链
除了编程能力的跃进,网络安全演练是 GLM-5.3 发布中最受瞩目的工程突破。在白盒漏洞识别与验证测试 CyberGym 中,GLM-5.3 取得 84.5% 的得分,登上开源模型第一位,并超越了闭源模型 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%。这证明模型在代码静态分析与漏洞模式匹配领域具备极高的识别精度。
在考察真实漏洞利用推理的 ExploitBench 中,GLM-5.3 得分为 54.4%,较 GLM-5.2 的 24.4% 实现了翻倍增长。然而在此项目中,Mythos 5(78.0%)与 GPT-5.6 Sol(76.5%)依然保持着领先优势。在限定时间预算的 ExploitGym 攻击任务中,GLM-5.3 在 2 小时和 6 小时内分别完成了 105 个和 130 个利用任务,远高于前代模型的 29 个和 39 个。
图:GLM-5.3 网络安全三大 Benchmark 表现。来源:z.ai/blog/glm-5.3
智谱在技术报告中确认了一个工程规律:模型越往攻击利用链深处演进,能力增长速度越快,同时与顶尖闭源模型的绝对差距也越大。在与国内多个安全团队的协同实战中,GLM-5.3 在 269 个开源和商业项目中成功挖出 2436 个漏洞。其中中高危漏洞达 1097 个,覆盖操作系统内核、浏览器引擎、底层网络协议与基础基础设施,甚至包括潜伏近 40 年的古老代码缺陷。
训练过程中引入的真实漏洞识别环境与攻防数据,推动了网络安全能力的加速演化。模型在演练中表现出跨越多个利用阶段进行自主推理的能力,能够主动制定并执行完整的漏洞利用链计划。这种安全能力的涌现速度超出了团队的预期,也给后续的模型部署与开源审核提出了全新的课题。
深度安全约束与意图识别:开源场景下唯一的防御长城
为了应对自主黑客能力的潜在风险,智谱在 GLM-5.3 中构建了三层纵深安全防御体系。最外层由轻量级分类模型构成,负责高效拦截大规模低级滥用请求。中间层部署实时推理监控器,对智能体在长程执行过程中的上下文意图进行动态追踪。最内核则是模型内部的深度安全约束,确保模型从底层拒绝生成破坏性攻击代码。
在开源模型的部署场景中,由于外层防护墙可以轻易被绕过或移除,模型自身的内核安全约束成为了防止技术滥用的防御长城。安全团队采取了基于意图与语境的动态风险分级机制,替代传统的关键词过滤。网络安全攻防在文本描述上高度相似,单纯封杀专业词汇会导致正常的安全防御研发被误杀。
基于对能力扩散风险的审慎评估,智谱决定将开源权重的发布时间推迟两周,待安全评估与防护加固彻底完成后再行公开。这一决策回应了近年来全球 AI 安全领域的严峻态势。此前技术社区曾发生 Hugging Face 平台攻防事件,Mythos 5 也曾在测试中自主连网尝试注册账号,引发了行业对高级智能体失控风险的高度警惕。
预训练红利见顶:后训练竞赛重塑大模型成本结构
GLM-5.3 的发布为大模型技术演进路线提供了一个清晰的工程样本。在预训练基座参数完全保持不变的前提下,仅仅通过一个月的后训练扩展,模型就实现了 50% 的编程能力增长。这表明行业正加速从单纯追求预训练参数规模,转向依靠后训练精细化压榨模型潜能的新阶段。
这种技术路线的转向同样引发了关于评测方法论的工程讨论。智谱在此次发布中重点强调了自建私有测试集 Z.ai Code Bench 的成果,其初衷在于规避公共测试集可能存在的污染问题。不过由于私有测试集的具体任务、评估脚本与运行产物尚未完全向外界开放,第三方机构在复现和验证其结论时仍面临一定透明度挑战。
从部署经济的角度来看,GLM-5.3 展现出的 Token 消耗效率揭示了后训练的另一重价值。用 5 万 token 完成以往需要 12 万 token 才能达成的任务推理,意味着推理算力成本的成倍降低。在企业级 API 大规模落地的背景下,后训练决定了模型的性能上限,同时也重塑了推理算力的成本结构。
GLM-5.3 的核心价值在于展示了后训练在不改变基座的条件下所能触及的能力边界。当 1M 上下文与 128K 最大输出能力的模型已在 ZCode、Claude Code 及 OpenCode 等平台开放使用时,后续关于全新架构与倍增参数的下一代竞争演进已经拉开序幕。后训练扩展所建立的效率优势,将继续成为前沿大模型工程竞争中的重要杠杆。
参考链接:
- 智谱 GLM-5.3 发布博客
- The Decoder:Zhipu AI releases GLM-5.3
- 雷峰网:GLM-5.3 来了——底座没换,编程暴涨 50%
- Pandaily:GLM-5.3 发布报道