Cerebras 公共端点只放两款模型,Qwen 是唯一非 OpenAI 席位

Cerebras 公共端点只放两款模型,Qwen 是唯一非 OpenAI 席位

QwenCerebras开源模型AI推理

数据源:HN + web research

公共端点只放两款模型,Qwen拿下唯一外部席位

单 token 输出耗时 0.7 毫秒,整机持续吞吐达到 1500 tokens/s。2026 年 9 月,Cerebras 推理平台公共端点更新上线列表,阿里开源的 Qwen3.8-27B 赫然在列。在这处面向开发者的公开端点上,Cerebras 目前仅提供两款模型。一款是 8 月开源的 OpenAI gpt-oss-120b,另一款就是 Qwen3.8-27B。

此前 OpenAI 首次把开源权重交付给第三方平台,意在展示 3000 tok/s 的极限算力。Cerebras 挑选的第二款模型没有沿用欧美开源传统,而是直接切入国产顶尖权重。硬件平台仅设两个公共席位,Qwen 拿到了唯一的非 OpenAI 准入资格。

硬件厂商自建公共推理平台,向来习惯用超大参数旗舰展示算力峰值。Cerebras 将一半席位留给 27B 模型,反映出推理服务正在转向真实承载力。紧凑参数配合晶圆级架构,能用更低硬件开销跑出高并发吞吐。

Qwen3.8-27B 官方模型规格卡 图:Qwen3.8-27B 官方模型规格卡。来源:HuggingFace

该端点直接开放了并行工具调用、结构化输出以及图片输入能力。Qwen 官方在 8 月底至 9 月初密集更新,先后发布 2.4T 参数的 Max 版本与 Flash-Next。混合架构引入了门控网络,进一步优化了长程推演效率。Cerebras 选入 27B 版本作为默认端点,看重的是其在单卡与集群中兼备的工程成熟度。

实测1500速打破人机交互节奏

常规大模型在主流云端 GPU 上的流式生成速度,普遍在 30 到 80 tokens/s 之间。Cerebras 端点实测跑出的 1500 tokens/s,将单字生成延迟压至 0.67 毫秒。人类一次眨眼平均需要 200 毫秒。该端点生成数百字答案,用时甚至低于人类感官反应阈值。

根据基准测试估算,模型吐出单个英文虚词仅需 0.7 毫秒。人类正常说话的停顿普遍在 200 到 300 毫秒之间。传统交互是人类等待模型吐字,现在变成模型等待人类眼睛移动。这种时间差的逆转,消除了长文本生成的心理等待感。

这种吞吐表现重构了多智能体协作的交互链路。过去智能体执行复杂规划任务,往往需要连续触发数十次工具调用。几十秒的往返等待很容易中断人类使用思路。当单次推演降至数百毫秒级别,反思、校验和重试机制能够在会话中瞬时完成。

Cerebras 端点默认开启高推理深度模式,开发者亦可按需手动关闭以压榨速度。在计费层面,平台开出了输入 0.99 美元、输出 1.49 美元的百万 token 开发者价格。低廉的单次调用价格与毫秒级延迟结合,使得高频链式调用的商业探索具备了经济可行性。

SRAM装不下长文本,端点卡在128k窗口

Qwen3.8-27B 官方模型卡标称原生上下文为 262,144 tokens,甚至具备百万级扩展能力。但在 Cerebras 的在线端点上,免费用户仅能使用 64k 窗口,付费开发者被限制在 128k。Cerebras 明确声明未剪枝模型,这一差距由晶圆级芯片的物理特性决定。

Cerebras WSE-3 芯片把 44GB 静态内存(SRAM)做在整块晶圆内部,直接免去了外部显存接口的读写延迟。然而片上 SRAM 面积成本高昂,难以容纳长序列产生的海量键值缓存(KV Cache)。为了在维持单批次 1500 tok/s 吞吐下保证多用户并发,平台只能在上下文长度上做工程妥协。

Cerebras 晶圆级芯片推理服务架构 图:Cerebras 晶圆级芯片推理服务架构。来源:Cerebras Blog

超长文本生成的内存开销随长度线性增长。当并发请求塞满片上缓存,芯片无法靠外部扩展内存分担压力。端点引入上下文缓存技术来优化首字延迟,但最大容量依然被锁死。这种硬件架构注定了超长文本与超高吞吐无法同时兼顾。

Hacker News 社区对这一工程取舍展开了详细讨论。有测试者指出,公共端点设置了每分钟 150k token 的输入速率限制。导入工程项目或较长日志时,请求很容易触发限流保护。对依赖全量上下文的代码分析场景而言,输入端流控在现阶段成为影响实际效能的关键瓶颈。

16GB显卡能私有化,云端吞吐逼近物理极限

在当下的模型矩阵中,27B 参数处于开源生态的平衡区间。经过适度 4-bit 量化后,Qwen3.8-27B 能够直接装入消费级 16GB 显存显卡,在本地离线运行。工程师可以在本地调试工具链,上线后直接切换至云端处理突发负载。

主流消费级显卡在本地运行该尺寸模型,通常能提供每秒 20 到 30 个 token 的推演速度。这足以满足单人代码补全与数据脱敏需求。企业可以在办公终端完成私有化校验,不必承担敏感数据出境的合规风险。

相比动辄千亿参数的巨型模型,27B 兼顾了推理泛化能力与轻量化门槛。企业无须采购昂贵的专有算力集群,普通工作站即可完成私有化部署。当业务出现并发洪峰时,云端平台能立即释放 1500 tok/s 的极速处理能力。

Cerebras 在官方技术文档中承诺,公共端点上线模型均保持原始架构,仅在存储侧做选择性权重量化。这种对开源权重的保真处理,消除了开发者对模型能力被裁剪的顾虑。本地验证逻辑与云端极速运行保持一致,大幅降低了跨平台迁移的适配成本。

推理硬件厂商用开源重构选型逻辑

过去欧美专用 AI 芯片厂商在展示生态适配时,几乎清一色选择 LLaMA 权重。如今 Cerebras 公开端点仅有的两张入场券中,Qwen 占据其中一席。这展现出国产开源模型在硅谷核心技术圈层中积累的工程认可度。

AI 推理服务正从炫耀峰值参数,转向追求真实单位效费比。算力厂商不再单方面押注大模型,而是看重准确度与延时的平衡。Qwen 覆盖了从单卡到混合专家的梯队,切中了硬件商展示性能的窗口。

芯片产业与开源社区的绑定正在经历重构。硬件团队需要用最能打的开源权重验证芯片效率,开发者则需要顶尖芯片释放模型潜能。双方在工程实践中相互借力,加速了推理硬件从实验室玩具走向规模商用。

Qwen3.8-27B 在晶圆级算力上的实测表现,为大模型落地确立了新的参照基准。开源模型既能在消费级显卡上低成本私有化运行,又能在云端晶圆级芯片上跑出 1500 tok/s 的超快响应。这种组合让工程团队在架构选型上获得了空前的自由度。决定开源模型长期竞争力的核心,正在从纸面跑分迁移到端到端的高效工程落地能力上。

参考链接:

  • Cerebras Inference 官方博客与技术规格公布
  • HuggingFace Qwen/Qwen3.8-27B 模型开源主页
  • Hacker News 社区热议:Qwen 3.8 27B on Cerebras
  • Qwen 官方团队系列技术路线与架构更新说明