最近关于 GPT-6 Astra 的讨论中,外界产生了一个显著的认知偏差:一项 2018 年就提出的架构优化技术,被当成了让模型失去可解释性的罪魁祸首。The Information 报道称 Astra 采用了「循环 Transformer」(looped transformers),并借此隐藏了推理链。把参数复用等同于掩盖推理轨迹,是将架构层面的算力效率优化与模型训练质量强行牵扯在了一起。
算力堆叠造就偏科能力
2026 年 9 月上旬发布的 GPT-6 Astra 在 ARC-AGI-3 测试中拿下 99.9% 的成绩,大幅跨越前代 GPT-5.6 Sol 的 7.8%。但当我们看向 Artificial Analysis Coding Agent Index 等独立第三方基准时,它虽身处前沿但未与其他模型拉开明显身位。第三方基准与厂商自测数据的差异揭示了一个事实:这一代模型的能力提升呈现显著的模态差异。Astra 并没有在所有传统指标上形成降维碾压,而是在计算机使用(computer use)等图形界面操作任务上展露了极大的优势。
为了训练出这种专长,OpenAI 投入了惊人的资源配置。他们采购了数万台 Mac Mini 与 Mac Studio,专门用来构建真实的强化学习环境。NVIDIA CEO 证实,Astra 的训练过程动用了约 10 万块 Grace Blackwell GPU。底层算力的暴力投入和特定场景的专用强化环境,直接支撑起了新模型在交互操作上的能力跨越,使其在配合 harness 执行点击、预测鼠标动作等实操环节中表现非凡。
图:三组编程基准与一组数学基准上 GPT-6 Astra 与前代模型的对比。来源:Ahead of AI / Sebastian Raschka
图:Artificial Analysis Intelligence Index v4.2 上的模型排名,Astra 在前沿但未拉开明显差距。来源:Artificial Analysis
循环架构只省内存不省算力
The Information 报道提到的循环 Transformer 并非新鲜事物,它本质上是让中间表示多次穿过同一批 Transformer block,在此期间权重相互共享。2025 年发布的 Nanbeige4.2-3B 让 22 个 block 跑两遍,等效于 44 次 block application,但只占用 22 个 block 的参数空间。论文指出两遍是效率最优解,增加到三遍虽有性能提升但不划算。这种架构复用买的是内存空间,算力消耗上没有抄任何近道。
社区和业界对此也有过多次激进尝试。ByteDance 的 Ouro-Thinking 2.6B 采用了更极端的配置,48 个 block 跑 4 遍产生 192 次计算。由于反向传播的梯度依然要穿透多次,整体计算成本与展开后的普通模型几乎对等。更关键的限制在于,由于两次 pass 的中间状态存在差异,KV cache 必须分开存储。Nanbeige 曾尝试共享 KV 以减半内存,却导致模型表现大幅下降,最终发布时依然维持了独立存储的设计。
2018 年的 Universal Transformer 早就尝试用学习出来的「halting probability」做自适应停机,让每个 token 决定自己需要跑几遍。Mixture-of-Recursions(MoR)方案则进一步引入了路由机制,通过 expert-choice 和 token-choice 两种方式让每个 token 获得专属的递归深度。MoR 论文表明,在最小规模下普通 Transformer 依然更优,但随着模型规模变大,MoR 开始追平甚至反超,且训练预算越小,这种资源利用的优势就越明显。
图:RNN 与循环 Transformer 的结构对比。来源:Ahead of AI / Sebastian Raschka
共享参数创造不了额外知识
《Beyond Parameters》研究严格验证了循环机制的能力边界:在参数规模不变时,多次循环几乎不增加模型能够存储的有效信息量。但在解答多步数学题等依赖过程推演的场景下,复用 block 能在不增加参数的前提下显著提升解答成功率。循环机制强化的是系统进行逻辑计算与推演的深度,它无法凭空生成模型未曾见过的知识增量。
在同等非嵌入参数与同等 KV cache 的严苛设定下,2026 年 9 月发布的 SMELT 论文重新评估了循环架构的真实效率。测试结果显示,在达到相同验证损失的目标时,该架构可减少 6.8% 至 18% 的训练算力消耗。它为模型开发者提供了一个极具性价比的工程选项,使得模型能够用相同的静态参数量换取更多次内部计算流转的机会。
图:潜在推理(latent reasoning)模型的循环结构示意,共享 block 每一遍都能拿到初始表示的输出。来源:Geiping 等人论文
缩短推理链源于更少试错
The Information 的报道将 Astra 推理时消耗 token 变少,直接解读为隐藏推理链带来的不可解释危机。这种推论在工程逻辑上站不住脚。对比前代模型即可发现,能力更弱的 GPT-5.6 Luna 在执行同等任务时,比性能更优的 Sol 还要多耗 80% 的 token。消耗 token 的减少,根源在于更强的模型犯错率更低,从而削减了大量无效的试错成本和路线回溯。
Astra 首席科学家 Jakub Pachocki 针对舆论公开澄清,强调前沿模型的计算图深度仍保持在 GPT-4 的两倍因子区间内。他直言不讳地指出,外界混淆的报道可能会引发一场奔向不可监控的竞赛。Astra 的 system card 确实承认了推理轨迹较 Sol 变短、信息量减少,但这并不能把监控体系的脆弱归咎于底层的循环架构。争论双方在链式推理监控难度增加这件事上存在共识,但引发这个问题的核心变量,绝不是参数是否被重复调用。
循环 Transformer 作为一项有效的架构调整,在算力效率上带来了确切的工程收益,但将它视作 Astra 表现跃升和不透明性增加的主因,严重高估了单一技术点的历史贡献。Astra 在交互领域的突破,依然建立在十万卡级别的暴力计算和专门强化的训练方案之上。当底层模型具备更强的直接命中答案的能力时,那些冗长的中间推理链自然会被剪裁。这是模型能力自然进化的直接结果。
参考链接:
- 报道:The Information
- 观点:Hacker News 社区讨论
- Ahead of AI 分析:Sebastian Raschka
- 论文:Mixture-of-Recursions / SMELT / Beyond Parameters