743B基座未动分毫:终端编码能力冲上28.3
4.6 到 28.3,这是 GLM-5.3 与前代 GLM-5.2 在 Terminal Bench 3.0 上的分值跨越。2026 年 8 月 14 日,智谱 z.ai 正式发布 GLM-5.3,其最大的工程特点在于完全沿用了前代 743B 参数规模的基座模型。所有的性能跃升均来自于后训练(post-training)阶段的强化学习环境扩展与算力倾斜。这说明高难度终端任务不需要频繁重训千亿级基座模型,强化学习能够充分挖掘出现有权重潜藏的执行上限。
在多项工程编码基准测试中,GLM-5.3 展现出显著的性能迭代。其在 DeepSWE v1.1 上取得 66.9 的成绩,较 GLM-5.2 的 46.2 大幅提升;在 Agents’ Last Exam CLI 测试中达到 28.5,刷新了开源模型的最高纪录。结构化的任务环境能够让相同参数规模的模型处理复杂度更深的多步依赖,在无需改变底座的前提下大幅推高实际解题率。
这种后训练收益在长时程代码仓库重构任务中尤为明显。在 FrontierSWE 与 SWE-Marathon v1.1 基准中,GLM-5.3 的得分分别从 67.5 和 19.4 提升至 78.1 和 42.5。复杂软件工程任务对模型的长上下文保持与环境反馈调整提出了极高要求,环境工程训练使得模型在面对高不确定性执行链路时具备了更强的自我纠错能力。
合成环境与Slime单数据流:Post-Training的工程解法
在训练架构层面,智谱采用了自研的开源强化学习训练框架 slime。该框架将 Megatron 训练端与 SGLang 执行端整合进统一的数据流设计中,大幅降低了长时程任务展开过程中的跨框架通信消耗。这种单数据流架构保障了模型在成千上万步的环境交互中依然维持极高的吞吐效率,为大规模后训练探索提供了算力基础设施。
针对强化学习中常见的奖励作弊(reward hacking)难题,团队搭建了一套由研究智能体驱动的环境合成管线。研究智能体从真实开发场景中抽离任务模式,生成包含多步依赖与隐藏状态的可运行长时程环境,再由判定智能体在不接触参考解答的情况下合成验证器。通过引入无操作检查与状态未解检查,验证管线确保了模型获得的每一个奖励信号都来自于真实问题的解决。
在推理效率方面,GLM-5.3 展现出更高效的 Token 使用策略。在 Max effort 模式下,模型凭借约 7.5 万个输出 Token 取得了 34.5% 的解答率,而前代 GLM-5.2 消耗 9.6 万 Token 仅达到 23.4%。强化学习训练优化了模型内部的思考路径,避免了盲目靠堆砌推理长度来换取解答率的无效消耗。
图:GLM-5.3 在各项编码与智能体基准上的性能对比。来源:z.ai 官方博客
意外涌现的 Exploitation:潜伏45年的漏洞被掏出
在扩展强化学习环境的过程中,GLM-5.3 表现出未经专门攻防训练即可自动涌现的网络安全能力。在 ExploitBench 基准中,其成绩从前代的 24.4% 翻倍至 54.4%;在 CyberGym 测试中达到 84.5%,超越了 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%。能力增长最快的环节集中在漏洞利用链的上游阶段,证明强化学习对环境反馈的敏感度直接提升了多步攻防路径的构建效率。
实测数据进一步印证了这种自动攻防探索的能力。在与国内多家安全团队合作开展的真实项目压测中,GLM-5.3 在 269 个开源项目中发现了 2,436 个安全漏洞,其中包含 1,097 个高危与严重漏洞。最古老的一个漏洞早在 1981 年即已引入代码库,潜伏时间长达 45 年。具备深度推理能力的模型能够沿着遗留代码的复杂执行路径展开回溯,找出传统静态扫描与人工审计遗漏多年的深层逻辑缺陷。
除了代码库级别的安全检测,自动化工具链的安全防护同样受到了冲击。VentureBeat 报道提到 GLM-5.3 在检测中发现了知名开发者工具 Cursor 的严重漏洞。这一结果表明自动漏洞挖掘的边界正在从常规系统软件快速延伸至现代开发基础设施,AI 智能体已经具备对复杂交互环境展开深层探索的能力。
图:GLM-5.3 在 CyberGym 与 ExploitBench 等安全评估中的表现对比。来源:z.ai 官方博客
开源权重的防线争论:延期发布与披露机制
开源模型获得强悍的网络攻防能力在社区引发了广泛讨论,相关帖子在 Hacker News 上获得了 1,096 分与 542 条讨论。部分安全研究者表达了对权重扩散的担忧,认为具备自动漏洞利用能力的开源模型可能会降低恶意攻击的技术门槛。未经限制的自动化利用工具一旦流开,可能给缺乏防御能力的旧系统带来安全压力。
开源社区的另一方则主张防御方同样需要同等水平的能力来展开系统加固。在现代攻防对抗中,只有防御团队掌握了具备深层探测能力的模型,才能在漏洞被恶意利用前完成补丁修复。如果出于安全顾虑过度限制权重的公开发布,可能会拉大安全防御者与掌握封闭模型资源方之间的能力差距。
智谱在治理策略上采取了分阶段推进的方案。官方宣布权重将在发布两周后公开发布,期间将集中完成模型的安全评估与加固工作。同时,在探索中发现的 2,383 个尚未修补的漏洞被纳入 Z.ai Security Disclosure Ledger 进行禁运管理,API 层面也强制开启思考过程(thinking 模式),以确保模型输出包含可审计的推理轨迹。
竞争范式的转移:环境复杂度决胜负
GLM-5.3 的实践清晰展现了后训练环境工程对已有权重的潜力释放。前沿 AI 智能体竞争的焦点正在从预训练阶段的语料规模与参数膨胀,转向强化学习阶段任务环境的构建质量与验证机制。在同一颗基座模型上实现性能倍增,验证了环境构建与验证器工程在智能体能力演进中的核心地位。
当开源模型开始同时具备前沿编码与自动漏洞挖掘能力时,整个行业必须适应技术研发与安全防护同步推进的新常态。如何在保持开源生态创新活力的同时建立起响应迅速的披露与修复机制,将是所有前沿模型开发者无法回避的课题。竞争的游戏规则已经改变,未来的胜负将取决于谁能构建出更严密、更具扩展性的后训练验证体系。
参考链接:
- z.ai 官方博客
- Hacker News 社区讨论帖
- VentureBeat 专题报道