断供两年后,10万张国产芯片扛下62万亿次AI调用

断供两年后,10万张国产芯片扛下62万亿次AI调用

人工智能国产芯片大模型

数据源:证券时报 + Martin Alderson

2026 年 8 月 26 日,智谱发布的 GLM-5.3-Flash 登顶海外测试平台,一周内斩获 62 万亿次 token 调用。这庞大数据洪流的算力底座,由 10 万张纯国产芯片集群承载。这标志着在高端芯片被断供两年后,中国 AI 在推理端完成了实质性的去美化替代。但这背后的代价同样清晰:在单卡性能落后约 4 年的现实下,笔者发现产业界正用 10 倍的芯片数量和成倍的电费账单,强行填平技术鸿沟。

匿名测试背后的硬核底座

发布前,GLM-5.3-Flash 化名 Ox-Alpha 在海外两大平台匿名测试并迅速霸榜。它采用了 320B 总参数和 18B 激活参数的混合架构,输入价格低至每百万 token 0.15 美元。这种极具攻击性的定价说明,国产算力不仅能用,还能在成本结构上支撑起商业化竞争。

GLM-5.3-Flash 官方发布页 图:GLM-5.3-Flash 官方发布页首屏:320B 总参数、18B 激活、原生多模态。来源:智谱官方发布页截图

在海外用户疯狂调用的那一周里,所有请求均流向了由自研高带宽网络连接的国产芯片集群。智谱采用了生产级的 EPD 分离式架构,端到端服务性能相比基线提升了 3 倍。这说明国产算力集群已经跨过了单纯能跑的及格线,具备了支撑世界级模型生产级高并发请求的能力。

数量换质量的物理代价

剥开光鲜的调用数据,底层硬件的物理限制依然冷酷。受限于 EUV 光刻机的缺失和 HBM 内存的出口限制,主力国产芯片在工艺制程和访存能力上仍面临热效率墙的严峻挑战。粗略估算,目前主力国产芯片的单卡算力仅相当于 4 年前英伟达 H100 的 60% 左右。

GLM-5.3-Flash 架构图 图:GLM-5.3-Flash 架构图:线性注意力加稀疏注意力,1M 上下文下 KV Cache 降低 4.44 倍。来源:智谱官方架构图

面对最新的国际前沿架构,单卡性能差距甚至能达到一个数量级。面对这种代差,中国工程师给出的解法极其暴力:依靠极高的系统工程复杂度,用 10 倍数量的芯片集群来生砸总算力。

极其高昂的电力账单

用十万张芯片堆砌出庞大算力,不可避免地带来了能耗的几何级飙升。采用这种规模换算力的方案,其每 token 的耗电量可能是国际前沿水平的 5 倍左右。电力成本占集群总成本的比例,从常规的 10% 到 20%,直接飙升至接近一半。

部分海外开发者也反馈,中国 API 的响应速度有时稍逊于西方头部供应商。但在庞大发电能力和充足工程师红利的战略补贴下,中国 AI 用一套高能耗的重资产方案,硬生生趟出了一条去美化的生存通道。

真实算力的极限测试

GLM-5.3-Flash 用 62 万亿次调用,证明了国产芯片集群在海量并发下的真实可用性。10 万张芯片和飙升的电费,是中国 AI 为打破技术封锁支付的清晰对价。当单卡性能存在客观代差,只能用十倍数量和系统级优化来弥补时,这场较量已经变成系统工程能力与战略决心的对抗。

这条路走得很贵,但它确实走通了。笔者以上分析皆基于目前事实得出。

参考链接:

  • 证券日报报道
  • 证券时报报道
  • 卡码笔记
  • Martin Alderson 分析
  • Lobsters 讨论