GLM-5.3-Flash 开源:前沿智能降至闪存级成本

GLM-5.3-Flash 开源:前沿智能降至闪存级成本

GLM-5.3-FlashMoE国产AI芯片SGLang开源大模型

数据源:HN + web research

2026 年 8 月 26 日,智谱(Z.ai)正式发布并开源 GLM-5.3-Flash 模型。这款拥有 3200 亿总参数、180 亿活跃参数的 MoE(Mixture of Experts,混合专家)多模态模型,在 Artificial Analysis 评测中把每任务推理成本降到了 0.045 美元,仅为前代模型的十分之一。模型在发布前曾以代号 ox-alpha 匿名登录 OpenCode 与 OpenRouter 平台,并在编程基准 DeepSWE v1.1 上取得 63.4 分的成绩,逼近闭源旗舰 Claude Opus 4.8。GLM-5.3-Flash 的出现,标志着前沿级智能能够以闪存级的算力成本交付,彻底验证了国产 AI 芯片、开源权重与规模化推理服务的协同链路。

稀疏架构与动态 KV 压缩:把 320B 压出 18B 的算力消耗

长上下文大模型的部署瓶颈向来集中在显存与计算开销上。GLM-5.3-Flash 采用了稀疏与线性注意力混合架构,将 320B 参数大模型的激活参数量成功锁定在 18B。在实际运行中,该架构相比前代 GLM-5.3 实现了注意力计算量降低 3.0 倍的突破。这表明稀疏与线性混合设计有效打破了传统注意力机制的二次方复杂度依赖,使得超大模型高并发部署时的矩阵乘法开销大幅降低。

除了计算量压减,上下文显存占用也是高吞吐推理的另一道关卡。GLM-5.3-Flash 在提供 1,048,576(百万)token 原生上下文窗口的同时,实现了 KV cache 内存占用降低 4.4 倍。显存压力的释放意味着单张显卡能够同时承载数倍于以往的并发 Request 请求。百万 token 级别的低缓存开销,使得模型可以一次性载入整套工程代码库或长视频片段,在长文本推理中避免了吞吐急剧衰减的问题。

编程与多模态双轮驱动:从 Agentic 复杂任务到视觉交互

代码与视觉能力的融合代表着大模型向复杂任务 Agent 演进的方向。GLM-5.3-Flash 属于 GLM-5 系列中首个原生支持图像与视频输入的多模态版本。智谱在技术报告中指出:「Code lets the model build and change the world. Vision lets it enter the world people see and use.」原生多模态融合避免了引入独立视觉编码器带来的跨模态表达损耗,使 Agent 能够直接解析软件界面截图并输出精准的操作代码。

图:编程与 agentic 基准对比图。来源:Z.ai blog

在具体基准测试中,GLM-5.3-Flash 展现出了突出的 Agentic 编程能力。模型在 DeepSWE v1.1 评测中取得 63.4 分,相比前代 GLM-5.2 的 46.2 分实现了大幅跃升。这 17.2 分的提升印证了 MoE 架构在多文件补丁生成与长流程代码重构中的上下文保持能力。而在 Z.ai Code Bench v1.0(搭配 Claude Code 2.1.207)测试中,模型取得最高分 29.0,极其贴近 Claude Opus 4.8 的 29.5 分。

图:Z.ai Code Bench v1.0 不同 effort 等级对比。来源:Z.ai blog

测试数据进一步证实,轻量化 MoE 架构配合测试时算力 Scaling(Test-time Compute Scaling)策略,可以在特定工程决策场景中提供与顶级闭源模型相当的推理能力。多项基准数据的提升表明,模型对工具调用逻辑与错误自我修正机制进行了针对性优化。这种改进让开发者在构建工程级 Agent 时能够降低对外部闭源 API 的强依赖。

国产芯片与 SGLang 推理栈:硬件效率的工程解法

高参数模型能否实现闪存级成本,取决于底层硬件与软件栈的深度配合。智谱技术团队在国产 AI 芯片集群上基于 SGLang 推理栈部署了 GLM-5.3-Flash,成功实现了 3 倍的端到端吞吐提升。该成绩表明国产芯片生态的性能突破已从单卡算力堆叠走向调度框架与硬件算子的协同工程。集群性能的提升使得国产硬件在实际服务场景中展现出了媲美主流 NVIDIA GPU 的单 token 成本优势。

在权威机构 Artificial Analysis Intelligence Index v4.1.1 综合评估中,GLM-5.3-Flash 获得了 57 分的高分,且折扣后每任务成本仅为约 0.045 美元。极低的计费标准直观展现了底层推理栈优化带来的经济效益。当软件栈调度效率与硬件算力并行度彻底打通时,超大规模模型的商业化落地便具备了极具竞争力的边际成本优势。

MIT 许可开源:全链路工程协同的重构动力

除了技术层面的架构优化,商业许可协议的选择同样决定了模型的工程扩散速度。智谱将 GLM-5.3-Flash 采用 MIT 许可证完全开源,并将模型权重同步上架 Hugging Face 平台。宽松的开源协议消除了企业级开发者在商业化部署时的合规顾虑,极大地加速了自建推理服务的普及。

在正式发布前,该模型曾以代号 ox-alpha 匿名上线 OpenCode 和 OpenRouter 平台,并在极短时间内成为当周使用量增长最快的开源模型之一。开发者社区在实测中对其低延迟与高吞吐表现给予了积极反馈。这一匿名测试的成功表明,闪存级成本与前沿智能的结合切中了开发者对高性能本地化推理的真实需求。

终局看算力结构:前沿模型的闪存化范式

大模型领域的竞争焦点正从参数规模的单纯堆叠转变为每单位算力的交付效率。GLM-5.3-Flash 通过 320B 总参数与 18B 活跃参数的 MoE 结构,证明了前沿模型完全能够在算力消耗大幅降低的同时保持顶尖性能。这种技术路径打破了以往高性能模型必然伴随高昂运行成本的固有认知。

当硬件算力、推理软件栈与稀疏模型架构达成深度协同,开发者不再需要为高昂的闭源 API 支付溢价。GLM-5.3-Flash 跑通的完整技术路径,为开源社区开辟了一条通往高性价比前沿智能的可靠轨道。未来大模型落地的游戏规则,必将由那些能够在极低算力成本下稳定输出前沿智能的工程实践所重塑。

参考链接:

  • Z.ai GLM-5.3-Flash 发布公告与技术博客
  • Hacker News 社区讨论与评测反馈