Cloudflare工程实测:量化三插件翻倍大模型并发

Cloudflare工程实测:量化三插件翻倍大模型并发

CloudflareKimiGLM量化SGLang

数据源:HN + Cloudflare Blog

2026 年 8 月 3 日,Cloudflare 在 Agents Week 技术系列博客中公布了 Workers AI 规模化服务国产开源模型 Kimi K2.6 与 GLM 5.2 的生产实践。基于开源推理框架 SGLang,技术团队通过 KV cache 量化、权重压缩与缓存完整性校验三项工程手段,在精度损失低于 0.8 点的前提下实现了并发容量翻倍。这项实践直接展示了前沿大模型部署的真实挑战——高并发场景下的资源瓶颈主要受制于显存带宽与容量的利用效率。

32并发即OOM:显存墙下的算力尴尬

长上下文推理的瓶颈在于 KV cache 对显存的巨量吞噬。以 Kimi K2.6 为例,原始 BF16 精度下可驻留上下文仅为 ~686,000 tokens,当并发推高至 32 时系统直接引发 OOM。Cloudflare 将 KV cache 从 BF16 量化至 FP8(e4m3)后,物理体积直接砍半,可驻留上下文翻倍增长至 ~1.37M tokens。

容量翻倍带来的最直接收益是并发性能的显著提升。在 64 并发压力下,FP8 实现了 2,192 tok/s 的吞吐量,比 BF16 的历史峰值提升了约 41%,同时单位 token 服务成本下降了约 30%。虽然单并发场景下 BF16 凭借未量化的直接计算优势稍微领先几个百分点(137 tok/s 对比 125 tok/s),但在高并发量产环境中 FP8 展现出压倒性的工程优势。

量化最令工程师担忧的是精度衰减,但实测基准打消了这项顾虑。在 GSM8K 测试中,BF16 与 FP8 分别取得 94.24 与 94.09 的成绩,MMLU 为 89.11 对比 89.04,工具调用有效率亦为 92.2% 对比 92.6%。工程团队在 Decode 阶段使用 FP8 处理 KV cache,在不牺牲学术与生产基准精度的同时,彻底打开了显存容量瓶颈。

FP8与INT4分工:Prefill与Decode的架构解耦

对于参数量更为庞大的 GLM 5.2,仅靠 KV cache 量化不足以挤出足够的显存空间。Cloudflare 将其权重从 FP8 进一步压缩至 INT4,使得模型 Checkpoint 从 705GB 缩减到 421GB,降幅达 40%。在 8-way 张量并行集群中,单张 GPU 显存占用从 ~88GB 降至 ~52GB,额外腾出了 ~1.18M tokens 的 KV cache 驻留空间。

推理阶段的物理瓶颈具有阶段差异性,必须进行针对性架构拆分。Prefill 阶段属于计算密集型,INT4 权重在线解包反而会拖慢计算,因此 Cloudflare 在 Prefill 池中保留 FP8 精度,获得 10,160 tok/s 的吞吐;而 Decode 阶段属于显存带宽密集型,INT4 降低了流式读取权重的带宽开销,使单并发 Decode 速度从 60 tok/s 提升至 92 tok/s(增幅 55%),64 并发吞吐由 1,672 tok/s 提升至 1,933 tok/s(增幅 16%)。

解耦式的 Prefill/Decode 架构让工程团队可以自由地为不同阶段匹配最佳数据类型。在精度测试中,INT4 权重的 GLM 5.2 所有 Benchmarks 性能与 FP8 相比相差均小于 0.8 点,其中 GSM8K 为 94.39 对比 93.56,MMLU 为 86.60 对比 86.54,mcxams 维持在 62/63 持平。这证明在计算与带宽分离的集群架构下,硬件特性的精细匹配能够在极低精度代价下换取巨大的吞吐提升。

共享缓存校验:千分之一开销的防护机制

量化提升了显存密度,也让更多并发请求开始共享同一物理 KV cache 内存池。在 Paged Attention、连续批处理以及缓存复用机制下,如果内存书签簿记出现微小偏差,系统可能向用户返回错误的交叉上下文数据。这种数据越界在边缘服务环境中是不可接受的安全与可用性风险。

Cloudflare 引入了共享 KV cache 完整性校验机制。系统为每个物理 cache page 绑定唯一 Tag,请求端在记录期待的映射关系后,会在 Decode 之前进行实时校验,一旦发现不匹配立即终止当前请求。这种防护机制没有融合进 Attention Kernel 以避免 GPU 线程组竞争,而是作为独立的 Batch Check 运行,默认的 No-op Tracker 更是保持了零基线开销。

防护体系的引入几乎没有对整体性能造成负面影响。实测数据显示,校验机制导致的吞吐量下降幅度仅在 -0.38% 至 -0.79% 之间,P95 延迟增加介于 +0.42% 到 +0.80% 之间。在毫秒级与百分之一以内的性能损耗下,工程团队成功构建了大规模显存复用下的数据安全屏障。

Cloudflare 博客封面图 图:Cloudflare 展示其在 Workers AI 上的推理系统部署架构。来源:blog.cloudflare.com

推理工程崛起:规模化服务的前置条件

Cloudflare 的实践标志着大模型服务竞争焦点的转移。从技术演进路径看,未来的集群不仅会在 Blackwell 架构上验证 NVFP4 权重,还将逐步将 FP8 KV cache 扩展至更广泛的边缘 Fleet 节点。当计算图调度、显存打包与内核校验成为常规操作时,单纯依靠模型原始权重尺寸判断部署成本的方式已不再有效。

量化与压缩不再是对硬件限制的无奈妥协,而是规模化商业服务的前置条件。借助与 SGLang 开源社区的紧密协同,Cloudflare 将上游 Patch 反哺给整个技术生态,展示了边缘算力网络支撑高并发复杂 Agent 调用的可行性。当模型吞吐量与成本结构由底层工程系统决定时,推理工程的深度将直接决定生成式 AI 应用的商业边界。

参考链接:

  • Cloudflare 官方博客