2500 道题,难度高到只有化学、经济、文学等领域的博士才答得上来。Claude Fable 5 跑完全部题目用了 78 小时 27 分,三天三夜不停机。同一批题,同一款顶级模型 GPT-5.6 Sol,只是换了一台「机器」,11 小时 11 分就跑完了。官方说法:快了近 7 倍,等于「一个工作日跑完人类知识前沿」。
图:HLE(人类最后考试)基准对比:2500 道题,Sol Ultrafast 用时 11 小时 11 分,Claude Fable 5 用时 78 小时 27 分。来源:cerebras.ai
这次的主角,不是模型,是芯片
先把新闻说清楚。OpenAI 和一家叫 Cerebras 的美国芯片公司合作,给 GPT-5.6 Sol 推出了「Ultrafast 极速模式」,先在 OpenAI 的接口里小范围开放,输出速度最高每秒 750 个 token(token 可以粗略理解为 AI 吐字的计量单位)。Cerebras 的说法是,极速模式比 Claude Fable 5 的输出速度快 11 倍,比另一款顶配模型的快模式快 5 倍。速度之外,官方强调「智能水平没有任何损失」——同一个大脑,只是换了台跑得更快的机器。
问题来了:为什么同一款模型,换台机器就能快这么多?这得从芯片讲起。现在 AI 算力几乎被 NVIDIA 的 GPU 垄断,各家大模型都跑在 GPU 集群上。GPU 的瓶颈在「搬数据」:模型有几万亿个参数,相当于一本几万页的字典,AI 每吐一个字,都要反复去查这本字典。字典放在芯片旁边的内存里,每次查询都要搬进搬出,路上堵车的时间比查字典本身还长。模型越大,堵得越狠。
Cerebras 走了一条相反的路:别人把一整块晶圆切成几百颗小芯片再拼起来用,它干脆不切了,把整块晶圆直接做成一颗超大芯片,再在上面塞进 44GB 的高速缓存——字典直接摊开放在灶台边上,厨师不用一趟趟跑仓库。用笔者的比喻,这就像同样的乘客,普通芯片是市区轿车,一颗颗排队过红绿灯;晶圆级芯片是高铁,整节车厢一起跑,运力完全不在一个量级。
图:Cerebras 的晶圆级芯片(Wafer-Scale Engine):一整块晶圆直接做成一颗芯片,不切割。来源:cerebras.ai
评论区泼来一盆冷水:这 7 倍有水分
新闻在技术论坛 Hacker News 上拿到了 382 分、152 条评论,但热评第一条就是质疑。用户 zozbot234 说得很直白:2500 道题是互相独立的,「本质是个能并行处理的负载,多堆几台机器就行」,真正该比的是「单道难题从头到尾的完成时间」。翻译成人话:你让 2500 个学生各做一道题,和一个学生连做 2500 道题,总用时差 7 倍,说明的是「人手够多」,未必说明「这个人跑得快」。
这个质疑有没有道理?有,而且点到了宣传说法的软肋。但评论区另一位用户 desmondl 补了个关键细节:官方文章里的动画其实展示了单题用时——Sol Ultrafast 每道题约 3 秒,Fable 5 约 27 秒,单题也快了 9 倍左右,而且那个「11 小时对 78 小时」的动画暗示的是串行跑完的。也就是说,官方最强的牌(7 倍)恰好是最容易被质疑的一张;而它手里那张更硬的牌(单题 3 秒对 27 秒),反而藏在动画里没写进标题。笔者对此的判断是:总吞吐可以靠堆机器糊弄人,单题延迟却糊弄不了——芯片的底子是真提速了,宣传数字选得取巧,但没说谎。
图:官方博客动画(截图):单题约 3 秒对 27 秒,总用时 11 小时对 78 小时。来源:cerebras.ai
评论区还有一层争论更有意思。有人说快当然好,但「尴尬并行」的任务(比如批量跑 2500 道题)用一堆慢机器也能堆出同样结果,多快意义不大;马上有人反驳:人类真正日常使用的场景——一个人和 AI 结对写代码、你问一句 AI 答一句——是没法并行拆分的,每一步都得等,单题延迟才是决定体验的东西。笔者的看法:两种说法都对,只是关注点不同。跑批量的研究员在乎总吞吐,等答案的普通用户在乎单题延迟,而 Cerebras 这次两样都占了,只是宣传时挑了最大的数字。
省钱账:一天省 500 美元
如果速度之争还停留在「公说公有理」,成本账就是实打实的了。评论区用户 aetherspawn 说自己公司 24 小时连轴跑前沿模型,实测发现 Sol 这模型特别「省话」——同样一个任务,它输出的 token 比 Fable 5 少 10 到 100 倍。按 token 单价算两家其实差不多,但 Sol 话说得少,账单自然小,换过去之后每天省下大约 500 美元。另一位用户补了一句:Sol 按 token 算本来就比 Fable 便宜。这里能看出 AI 降本的另一个路径:速度只是故事的一半,模型本身「话少、说到点子上」才是省钱的大头。硬件让 AI 变快,模型设计让 AI 变便宜,两条线在同时推进。
挑战者与垄断者
把镜头拉远,这桩合作还有一层产业含义。AI 芯片市场长期是 NVIDIA 一家独大,几乎所有大模型都跑在它的 GPU 上,生态、软件、供货全被捏在手里。Cerebras 是少数走完全不同路线的挑战者:别人切晶圆它不切,别人靠搬数据它把数据焊死在芯片里。晶圆级芯片的制造良率、散热、成本都是硬门槛,说它马上撼动 NVIDIA 为时过早;但 OpenAI 愿意给这条路背书,本身就说明垄断并非铁板一块。对普通人来说,这场竞争最直接的礼物,可能是 AI 越来越快、越来越便宜——毕竟厂家打架,用户受益。
这场争论教会我们什么
回头看,「快 7 倍」既是真的,也是挑着说的。2500 道独立题的总耗时,确实可以靠堆机器缩短;但单题 3 秒对 27 秒的差距,以及每天 500 美元的省钱账,说明硬件的提速是实打实的。宣传方挑了对自己最有利的数字,质疑方点中了数字背后的软肋,两边都没错,错的是只信一边。下次再看到「某某快了 N 倍」的新闻,不妨先问一句:比的是总时间,还是单次等待?前者可能靠人多,后者才见真功夫。
参考链接:
- Cerebras 官方博客: 加速 GPT-5.6 Sol Ultrafast(与 OpenAI 合作)
- Hacker News 讨论 (item?id=49289844)
- 评论区引述: Artificial Analysis 模型输出速度对比