GPT-6 发布当天,3 家模型服务同时宕机

GPT-6 发布当天,3 家模型服务同时宕机

OpenAIGPT-6ARC-AGIAI基础设施

数据源:HN + web research

2026 年 9 月 4 日,三件事同时发生:OpenAI 发布 GPT-6 Astra,OpenAI、Claude、Grok 三家头部模型服务在同一时段集体宕机,ARC Prize 在同一天上线了 ARC-AGI-3 官方测评并公布 Astra 成绩。HN 上关于 Astra 的帖子拿到 1091 分和 802 条评论,宕机帖 107 分、39 条评论。一天之内,发布、崩溃、计量争议全到齐——这三件事指向同一个问题:模型能力的叙事在加速膨胀,但支撑叙事的基础设施和评测标准都还没准备好。

三家同时宕,没人能解释为什么

OpenAI、Anthropic(Claude)、xAI(Grok)三家模型服务在 GPT-6 Astra 发布的同一时段出现故障。HN 的 Ask HN 帖子拿到 107 分和 39 条评论,评论区没有定论。有人怀疑 OpenAI 发布引发的流量冲击波及上游供应商,有人怀疑共用基础设施节点故障,也有人认为纯属巧合。

三家竞争对手同时段宕机,说明什么?至少说明一点:头部模型服务的基础设施比外界想象的脆弱。流量高峰叠加运维压力,冗余空间比用户以为的更小。发布节奏在加密,基础设施团队的压力也在同步上升。

ARC-AGI-3 半年就饱和,评测尺子追不上模型

ARC Prize 同日发布了 GPT-6 Astra 在 ARC-AGI-3 上的官方测评结果。ARC-AGI 的创造者 François Chollet 被问到「ARC-AGI-3 什么时候会饱和」时,给出了一个时间点:大约一年。但那是六个月前说的。Chollet 在 Astra 测评发布时承认:「Astra 代表的进展比我预期快了两倍。」

GPT-6 Astra 登上 ARC-AGI-3 排行榜 图:GPT-6 Astra 在 ARC-AGI-3 排行榜上的表现。来源:ARC Prize Blog

ARC-AGI 系列测评的设计初衷是度量「真正的通用智能」,区别于在固定数据集上刷分的传统 benchmark。但连设计者自己都低估了模型进步的速度,评测标准被追上的节奏远快于预期。尺子还没量完,就已经不够长了。

同一张排行榜,两套标准

Astra 测评发布的同时,ARC 记分牌上出现了一个尴尬场面。GPT-5.6 Sol 在排行榜上标注 7.8%,但 ARC 自己的说明文档里写着:「用 responses API harness 估算,Sol 能到约 30%。」同一个模型,换一个评测套件(harness),分数差了将近四倍。

这个差距让排行榜的可比性受到了质疑。如果 harness 不同导致分数差距如此之大,那排行榜上的排名到底在度量模型能力,还是在度量评测方法?ARC Prize 方面的理由是标准化需要统一 harness,但社区的反驳也有道理:既然自己都估算出了 30%,为什么排行榜上还挂着 7.8%?两套标准摆在一起,双方都说得通,但谁看了都别扭。

ARC-AGI-3 action/efficiency 对比图 图:ARC-AGI-3 不同模型的 action 与 efficiency 对比。来源:ARC Prize Blog

AGI 定义在被稀释,还是在被推进?

GPT-6 Astra 发布后,社区里同时出现了两种截然不同的反应。一方面,LessWrong 上有技术讨论在分析 Astra 的 recurrent 架构(19 points),讨论这种架构在长程推理中带来的实际增益。另一方面,HN 评论区里有尖锐的声音指出:AGI 这个词正在被稀释成 Sam Altman 的 IPO 话术——每次发新模型就离「AGI」更近一步,但「AGI」本身的定义从来没有锁定过。

两种声音都有事实基础。Astra 的 recurrent 架构确实代表了工程路径上的推进,Chollet 承认进展超预期也是第一手证据。但「进展快」和「接近 AGI」之间隔着一个关键变量:AGI 的定义放在哪里。这个定义目前由发布者单方面移动。计量标准也在快速迭代,「进步」和「定义调整」之间的界限就模糊了。

能力竞赛跑在了计量能力前面

GPT-6 Astra 发布当天的三件事,拆开看各有各的原因。放在一起看,指向同一个结构:模型发布的密度和声量在加速,但基础设施的稳定性、评测标准的一致性、「智能」一词的定义,全在追赶。Chollet 六个月前预估「一年」,现在变成了半年。排行榜上 7.8% 和 30% 并存,分数的可信度在打折。三家服务同时宕机,可靠性底线在承压。

能力叙事膨胀的速度,已经快过了验证能力的速度。下一个模型发布时,排行榜上的尺子够不够用,可能比模型本身的分数更值得关注。

参考链接:

  • ARC Prize Blog
  • OpenAI
  • LessWrong
  • HN 讨论 (item?id=49554643)
  • HN 讨论 (item?id=49555691)