一台 700 瓦的芯片,打赢了一台 1400 瓦的芯片。
8 月 25 日,OpenAI 在 Hot Chips 2026 大会上公布了自研推理芯片 Jalapeño 的首批实测数据:在 SemiAnalysis InferenceX 基准下,Jalapeño 每千瓦的 token 吞吐量达到英伟达 Blackwell GB300 的 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍。功耗只有对手的一半,产出却更高。这个结果的重量,不在于数字本身,在于它说明了一件事:AI 算力竞争的胜负标准,已经从「谁算得快」悄悄换成了「谁用更少的电产更多 token」。
图:Jalapeño 芯片官方主视觉。来源:OpenAI
16 个月完成别人三年的工作
Jalapeño 是 OpenAI 与博通(Broadcom)联合设计的专用推理 ASIC(专用集成电路),采用台积电 3nm 工艺,搭载 HBM4(第四代高带宽内存),热设计功耗(TDP)约 700W。这颗芯片从 2024 年中启动设计,到 2026 年 6 月官宣、8 月公布实测结果,全程约 16 个月。行业惯例是:一代 ASIC 从零到流片,三年起步。
SemiAnalysis 将这个速度称为「AI 加速芯片设计」真实生效的证据,意思是:AI 工具已经把芯片设计流程本身压缩了。16 个月的时间表放在半导体行业,属于异常值。OpenAI 在现场甚至演示了用 Codex 提示词把《毁灭战士》移植到这颗芯片上运行——这说明 Jalapeño 是通用推理芯片,认的是推理工作负载,吃任何模型权重,并非只服务自家产品。
为什么能效比绝对性能更重要
要理解 Jalapeño 的成绩为什么重要,先要理解现在数据中心缺的是什么。
黄仁勋在 Computex 2026 上说过一句话:「如果你有 1 吉瓦电力,每瓦吞吐就是你的收入。」SemiAnalysis 的判断更直接:「今天的数据中心是电力受限的。」电网接入审批排队时间,远超硬件建设周期。xAI 为了给 Colossus 2 集群供电,被迫自建燃气轮机——这件事本身就说明了问题的严重程度。钱可以砸,电网不是想接就接。
在这个背景下,每瓦电产出多少 token,就是每一度电换来多少收入。 Jalapeño 用一半功耗实现 1.5 至 1.9 倍吞吐,折算成同功耗下的对比,差距会更大。这解释了为什么 OpenAI 选择将这个指标作为核心战场——这是它在现实约束下能赢的那场仗。
成绩的含金量与保留意见
图:InferenceX 基准下各芯片每兆瓦 token 吞吐对比,Jalapeño 全面领先。来源:SemiAnalysis / OpenAI
实测数字亮眼,但 SemiAnalysis 给出了三条保留意见,读懂它们和读懂数字本身同样重要。
第一,所有数字由 OpenAI 自行提供。SemiAnalysis 团队亲赴实验室,确认了 InferenceX 基准在真实硬件上运行,但没有独立跑完整套测试。第二,更公平的对比对象应该是英伟达 Vera Rubin(同样使用 HBM4),而非 Blackwell GB300——Rubin 已开始出货,Jalapeño 此时还只有工程样片。第三,测试使用的模型不是当前最大规模的前沿模型,适用范围有边界。
还有一个细节值得单独拎出来:Jalapeño 的这些成绩,全部用「单 token 预测」(STP)模式跑出来,没有启用投机解码,没有做 prefill-decode 分离。而图上所有对手芯片,都已经打开了各家最优配置加上「多 token 预测」(MTP)的加成。英伟达 Vera Rubin 在 7 月公布的 MTP 成绩,也被 Jalapeño 的 STP 吞吐超过。这意味着 Jalapeño 还有牌没打出来。
英伟达护城河第一次被客户从内部凿穿
OpenAI 过去是英伟达最大的客户之一。现在它造出了一款在能效维度打赢英伟达旗舰的芯片,并且公开展示了对比数据。
这件事的结构意义比技术意义更大。芯片行业历来是资本和时间的壁垒——三年周期、数十亿美元投入、良率风险。这些壁垒组合在一起,构成了英伟达护城河的基础:客户买不起自研,就只能买英伟达。Jalapeño 16 个月完成流片,打破了「三年周期」这道壁垒。OpenAI 证明了,在 AI 工具辅助下,这道护城河可以用更短的时间穿越。微软 Maia、Google TPU、亚马逊 Trainium 都在做类似的事,但它们都没有 OpenAI 这次来得这么正面、这么公开。
模型厂商自研芯片,原本是为了摆脱对英伟达的依赖、降低成本。Jalapeño 的数据说明,这件事已经不只是成本控制——它在能效这个新战场上已经可以正面竞争。
DeepSeek R1 在 Jalapeño 上跑出了单并发 700+ tokens/s/user,Kimi-K2.5 和 GPT-OSS 达到约 1400 tok/s/user,GSM8k 精度与英伟达芯片持平。这些都是在工程样片阶段的数字,量产后通常还有优化空间。
游戏规则变了
Jalapeño 还不是一款量产产品。它是工程样片,对比对象的选取存在争议,数字由 OpenAI 自己提供。这些保留意见都成立。
但它已经充分说明了一件事:AI 算力的竞争维度已经发生了实质性迁移。从「谁的 FLOPs 更多」转向「谁用更少的电产更多 token」——这个迁移是由数据中心的物理约束决定的,不是由营销决定的。英伟达过去在这个新维度上没有对手,Jalapeño 的出现意味着它第一次有了来自客户侧的正面挑战者。下一个问题是:当 OpenAI 的芯片进入量产、其他大模型公司跟进时,英伟达的定价权会不会随着这个维度的竞争而收窄?
参考链接:
- SemiAnalysis: OpenAI Jalapeño - Better Than Nvidia Blackwell
- OpenAI 官方博客: Jalapeño’s first results show industry-leading performance
- Tom’s Hardware: OpenAI’s 700W Jalapeño ASIC outpaces 1,400W Nvidia flagship
- TechCrunch: OpenAI’s Jalapeño chip is built for fast inference at scale
- HN 讨论 (item?id=49434378)