匿名模型的真身与国产算力豪赌
2026 年 8 月 26 日,智谱揭晓了过去一周在开发者社区霸榜的匿名模型身份。这个代号为 Ox Alpha 的大模型在 OpenRouter 上拿下了 19% 的周流量份额,把 DeepSeek 挤下了第一的位置。这周的免费测试流量,全部跑在约 10 万颗纯国产芯片构成的集群上。
GLM-5.3-Flash 在推广期给出了每百万输入 Token 仅 0.075 美元的定价,大约是西方前沿模型的百分之一。**当价格被击穿到这个量级,技术竞争已经完全转变为体系化的工程成本战。**这套模型拥有 320B 总参数和 18B 激活参数,并支持原生多模态输入,展示了中国 AI 厂商在极低成本下的系统调度能力。
数量换质量的工程折中
目前单颗国产顶配芯片的算力,大约只有 4 年前英伟达 H100 的 60%。如果直接对标英伟达最新的 Rubin VR200,单片算力差距达到了一个数量级。中国 AI 公司应对硬件代差的策略粗暴且有效:用堆叠 10 倍数量的芯片来强行填平算力鸿沟。
图:GLM-5.3-Flash 在各项基准测试中的成绩。来源:Z.ai 官方模型卡
这 10 万颗芯片推测是华为昇腾 910c 甚至 950 系列,单芯片拥有 96GB 的 HBM2e 内存,并提供约 1.6 PFLOPs 的 INT8 算力。这种通过庞大集群硬扛顶级模型的做法,本质上是用整体架构的冗余来弥补单点技术的不足。
电费与吞吐量的残酷平衡
在没有极紫外光刻机的情况下,7 纳米以下的先进工艺通道被堵死。用庞大的数量换取总算力,直接导致整个系统的电力效率大幅下降。单片 600W 功耗的芯片在十万级别的集群中,带来了巨大的供电和散热压力。
业内估算,这种庞大集群的电力消耗是同等算力下西方架构的 5 倍,电费在整体算力成本中的占比从 20% 飙升到了近 50%。这种靠大幅拉升能耗换取整体性能的方案,是对中国基建优势的一次极限压榨。
图:十万卡级别的国产算力集群想象图。来源:AI 生成
软件工程成为最后的胜负手
为了让 10 万颗性能受限的芯片协同工作,智谱在底层采用了基于 SGLang 自研的推理引擎。硬件存在短板时,软件调度能力就成了维持系统稳定运转的生命线。海量芯片之间的数据同步和显存分配,极大考验了开发团队的工程底蕴。
不过争议依然存在。部分社区开发者发现智谱官方 API 的生成速度约为每秒 35 个 Token,慢于西方同级别模型的 48 个以上。笔者认为,在完全受限的硬件条件下,能跑通整套系统并吃下全球第一的流量,已经印证了这套极限堆叠方案的工程可行性。
重塑算力游戏规则
GLM-5.3-Flash 依靠 10 万颗国产芯片登顶的故事,证明中国 AI 行业找到了一条摆脱对英伟达绝对依赖的路径。这场胜利的本质,是把单片算力劣势转化为了系统级的工程挑战。
落后四年的单片算力通过十万级的极致堆叠,依然能在全球市场卷出极低的价格并拿下份额第一。中国 AI 正在用最传统的规模工程,强行撕开前沿算力的封锁缺口。当然,这种粗暴路线能否在长期商业化中持续覆盖高昂的电力成本,仍需更多时间与市场的验证。
参考链接:
- Z.ai 官方公告
- HN 社区讨论