预训练权重冻结下的性能跃迁
2026年8月14日,智谱 Z.ai 宣布发布全新旗舰模型 GLM-5.3。令人意外的是,这个在多个权威基准上刷新开源 SOTA(State of the Art)记录的模型,其底层预训练权重与半年前发布的 GLM-5.2 完全一致。智谱团队在研发报告中明确证实,GLM-5.3 的性能提升全部来自后训练(Post-training)阶段的强化学习(Reinforcement Learning,简称 RL)规模化扩展。
这一成果清晰地表明,大模型的技术竞争重心正加速从基座预训练转移至后训练规模化。智谱通过构建高复杂度的交互环境与长程 RL 训练,成功在零基底改动的前提下把编码与智能体演算推向了前沿水平。强化学习规模化在大幅提升编码效率的同时,也自然触发了系统级网络安全漏洞挖掘能力的非线性涌现,使得安全防御与攻击能力同步成为了后训练规模化的工程副产物。
官方公布的数据显示,GLM-5.3 在自研的 Z.ai Code Bench 上实现了较 GLM-5.2 高达 50% 的综合性能提升。在推理计算效率上,其 High effort 模式以 31.4% 的准确率和 50K 的 Token 消耗,超越了 Opus 4.8 在 120K Token 下取得的 29.5% 成绩。这表明后训练扩展在大力挖掘基座模型潜能边界的同时,也在更高搜索深度下实现了单位计算算力的效率倍增。
编码基准刷新与推理 Token 效率
在公开通用智能体与编码基准测试中,GLM-5.3 展现出了跨越式的成绩增长。在衡量终端操作能力的 Terminal Bench 3.0 测试中,GLM-5.3 的得分由 GLM-5.2 的 4.6 分跳升至 28.3 分,超越了 Kimi K3 的 17.4 分,并逼近闭源前沿模型 Fable 5 的 33.7 分与 GPT-5.6 Sol 的 34.6 分。在软件工程基准 DeepSWE v1.1 上,其解决率从 46.2% 提升至 66.9%,而在复杂问答基准 Agents’ Last Exam 中也提升到了 28.5%。这种在多维基准上的齐头并进,验证了强化学习扩展在长上下文工程推演与复杂命令行交涉中的通用泛化能力。
在 Token 消耗与推理深度的平衡上,GLM-5.3 展现了优异的收敛效率。在 Max effort 模式下,GLM-5.3 仅需约 75K Tokens 即可达到 34.5% 的解答成功率,而上代 GLM-5.2 消耗 96K Tokens 仅能达到 23.4%。这种用更少思考步骤获取更高求解准确率的表现,反映出模型在后训练阶段养成了更精准的推理路径剪枝策略,降低了无效耗能。
图:GLM-5.3 与对比模型性能总表。来源:Z.ai 官方博客
漏洞利用能力的非线性涌现
随着编码推演深度的提升,GLM-5.3 在网络安全(Cybersecurity)测试中展现出了瞩目的涌现能力。在评估漏洞分析能力的 CyberGym 测试中,GLM-5.3 获得了 84.5% 的得分,超越了 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。在针对复杂环境利用的 ExploitBench 基准中,得分从 GLM-5.2 的 24.4% 直线上升至 54.4%,实现了翻倍增长。这表明复杂代码分析与环境交互能力的增强,会顺理成章地转化为对系统边界隐患的深度探查能力。
在更具挑战性的动态安全测试集 ExploitGym 中,GLM-5.3 在 2 小时和 6 小时的限时推演中分别解出了 105 个和 130 个攻防任务,相比 GLM-5.2 的 29 个和 39 个呈现量级增长。在实际工程落地中,智谱与国内安全团队合作,对 269 个真实开源项目展开安全审计,成功挖掘出 2436 个隐匿漏洞,其中包括 107 个严重漏洞和 990 个高危漏洞。其中最古老的一个漏洞源自 1981 年的代码引入,在项目中潜伏长达 45 年,所有发现漏洞的平均潜伏期达到了 26.6 年。这些海量历史遗留漏洞的被捕获,证明长上下文推理模型在大规模代码静态分析与动态符号执行融合上具备了人类专家难以比拟的排查效率。
图:网络安全能力 CyberGym、ExploitBench 与 ExploitGym 得分对比。来源:Z.ai 官方博客
安全能力的大幅提升呈现出双刃剑属性,促使团队重新考量模型的开源策略与服务形态。在发现的 2436 个漏洞中,有 2383 个目前仍处于禁运保护期(Embargo)内,仅有 53 个已完成修复并公开披露。由于后训练规模化不可避免地强化了代码攻击链条的自动化推演能力,智谱宣布将权重开源时间推迟两周以完成更全面的安全审计与防御加固。
用 slime 框架解决长训练吞吐瓶颈
实现零基底变动的后训练跃迁,离不开底层工程架构的创新支撑。智谱开源了名为 slime 的强化学习后训练框架,该框架深度集成了 Megatron 训练分布式架构与 SGLang 推理 Rollout 引擎。在传统的长程编码 RL 训练中,训练端与 Rollout 采样端往往存在策略采样偏差和通信开销巨大两大难题。slime 架构通过优化的对数概率(logprob)同步机制,将训练与 Rollout 之间的一致性误差降低至 1e-7,降幅超过 99.99%。这一工程突破彻底消除了长推理链条下采样数据漂移带来的训练抖动,为纯 RL 的稳定扩展奠定了算力基石。
依靠 slime 框架对算力管线与内存复用的极限优化,GLM-5.3 在长程编码 RL 场景下的端到端训练吞吐量提升了 2.3 倍。在服务交付层面,智谱调整了 API(Application Programming Interface)调用策略,强制启用了思考模式(Thinking enabled),并提供 Low、High、Max 三种思考力度选项以取代传统的无思考直接输出。同时,GLM Coding Plan 转向积分计量模式,并推出非高峰时段 50% 积分扣减策略以平衡集群算力负载。这种软硬件一体的架构设计与服务策略,保障了算力资源向高价值的长程深度推演任务集聚。
当后训练成为模型竞争的分水岭
GLM-5.3 的成功迭代,为大模型行业提供了一个清晰的演进样本。智谱官方引述的 “Scaling post-training is all we did for GLM-5.3.”,揭示了在预训练基座日趋同质化的当下,后训练环节正成为决定模型上限的关键杠杆。当同一套预训练权重通过后训练规模化能够在工程编码和安全挖掘上拉开巨大的性能差距时,未来的模型竞争战场已经转移到了环境复杂度设计与长程 RL 训练工程效率之上。
与此同时,GLM-5.3 意外拉响的网络安全警报也提醒着技术社区,能力的快速跃迁往往发生于原先相对落后的推演环节。后训练扩展在赋予模型强大代码防御力的同时,也降低了自动化漏洞利用的门槛,这使得开源模型的交付超越了单纯的权重分发,延伸到了全链路的安全评估与伦理治理。智谱选择在完成加固后再行开源,展示了在前沿技术突破与公共安全风险之间寻找平衡的工程责任感。
参考链接:
- Z.ai 官方博客 GLM-5.3 发布公告
- Z.ai Code Bench 与网络安全能力评估报告
- slime 开源强化学习后训练框架技术文档