10.3%跃升70.6%:中档模型撕毁了算力定价表

10.3%跃升70.6%:中档模型撕毁了算力定价表

AI编程模型AnthropicClaude

数据源:Anthropic 官方公布

七倍得分暴涨但账单没动

2026年9月28日,Anthropic 推出了 Claude 5.5 家族的第二款模型 Sonnet 5.5。官方公布的数据里,最反常识的一条落在 Terminal-Bench 4.0 编程基准上。它的通过率从上一代的 10.3% 跳到了 70.6%。在这个测试代理编程能力的核心榜单中,它反超了同世代旗舰型号 Opus 5.5 的 66.4%。

在另一项代码测试 CursorBench 4.0 中,它拿下了 55.5%。它压过了上一代的 34.1%,也紧逼 Opus 5.5 的 57.8%。它的计费表纹丝不动。作为定位上的「便宜一档」,它的输入价格维持在每百万 token 2 美元。输出 10 美元,缓存读取 0.20 美元。

在评估人类真实计算机操作的 OSWorld 2.1 基准上,它拿到了 80.1% 的成绩。它是第一个只靠看屏幕截图就能打通《宝可梦红》的 Sonnet 型号。不仅是代码生成,在衡量多模态识图能力的 Chartography 基准中,它的成绩是 61.6%。上一代仅有 15.6%。

在针对44个不同职业真实工作任务的 GDPval-AA v2.1 评估中,它的得分达到 1844。这与 Opus 5.5 的 1846 几乎平齐,把上一代的 1449 抛在身后。AA-Briefcase v1.1 基准得分也从 1359 涨到 1811。算力价格表上的中游选手,现在直接交付了超越前沿梯队的工程接管能力。

效率重构砍掉九成单次成本

在同样的单位定价下,用户掏出的算力成本变少了。官方说明指出,在处理范围明确的日常任务时,Sonnet 5.5 通常需要更少的 token。输出速度比上一代快了 30% 以上。官方实测数据显示,单次任务的资金消耗最多比上一代便宜 30%。这一代的性能飞跃源于执行步骤的物理压缩,而非算力规模的扩张。

根据官方的对照说明,把 Sonnet 5.5 限制在「中等 effort」档位下运行,它的最终成绩依然超过了上一代模型满负荷运行时的最好成绩。在这个中等档位下,完成单个任务的成本不到原先测试的十分之一。

早期测试方观察到,新模型更擅长批量合并工具调用。它直接减少了与外部环境交互的总推理步数。Reddit 开发者社区最集中的讨论也指向这个方向。不懂架构的「vibe coding」本来会烧掉巨量 token 来试错。模型学会合并请求和精准调用工具后,冗余消耗断崖式下跌。

单次任务成本与准确率对照 图:同一模型在不同 effort 档下的落点,越靠左上角每一美元买到的能力越多,Sonnet 5.5 落在旧模型左上侧。来源:Anthropic

为什么拉满算力资源反而会掉分

但在复杂的 FrontierCode 1.1 主集测试里,出现了反直觉的掉分现象。模型的 effort 设定在 Xhigh 档时,它拿到了 52.1% 的成绩。如果继续推高算力投入到 Max 档时,分数反而暴跌到了 46.2%。同基准下的 Opus 5.5 是 54.4%,GPT-6 Sol 是 49.3%。计算资源的投入不再保证产出,过度调配代理带来了不可控的系统损耗。

官方对此的排查解释是,在 Max 档位下模型在后台更频繁地调用了代码审查技能。它试图把审查工作拆借给大量的子 agent 处理。细碎的任务分发导致了严重的超时问题。

各个子 agent 之间缺乏同步,频繁做出越界修改。FrontierCode 系统会对超出原始范围的改动施加严厉惩罚。代理执行的边界在多层级中失控时,单体推理优势就被调度开销和错误传导抵消了。

基准性价比落点 图:另一组基准的成本与准确率曲线图,对照 Sonnet 5.5 与旗舰型号的性价比位置。来源:Anthropic

能力溢出倒逼防线向下部署

当便宜档模型具备极强的代码执行力时,它的破坏力等比例放大。官方明确表示,Sonnet 5.5 展现出的网络安全能力与上一代旗舰 Opus 5 处于同一水平线。它成了产品历史上首个自带完整网络攻击护栏与强制回退机制的 Sonnet 型号。生物学护栏维持了与上一代相同的规格。安全防线的部署层级向下移动,证明高危指令的生成能力不再是旗舰型号的专属。

除了防护物理攻击,它也是首个携带防蒸馏分类器的中档型号。过去攻击者只在面对旗舰模型时,动用大量自动化账号骗取输出用于训练竞品。给 10 美元输出价位的产品加装反蒸馏护栏,意味着它的响应质量达到了训练母本的精度。廉价模型的日常输出,第一次成了需要被严密保护的核心资产。

业务端压降了实际迭代轮次

基准测试的数字最终在业务端得到了验证。在服务商 Base44 追踪的 118 个真实应用构建场景里,Sonnet 5.5 平均只需要 3.6 轮对话迭代就能达到 Opus 5 的代码可用水平。Opus 5 在同样的任务下平均需要 7.7 轮。

游戏大厂 Epic Games 在内部测试后给出评判,它在系统设计审计和底层数据流评审上,达到了更高一档旗舰模型的代码质量。Unity 团队工程师反馈,它独立完成了 90% 的多步编辑器调用与编码任务,通过了严格的运行时复核。

官方架构师在发布附言中承认,基准测试仅仅反映了能力的一个切面。面对环境未知的复杂开放式任务时,同世代的 Opus 5.5 依然展现出了更强的长程规划能力。主打极速响应的 Haiku 5.5 将在未来几周内加入产品线。中档型号的胜利建立在对明确边界内工具调用的单步效率上。它的能力跳跃,拆解了前沿模型梯队固守的价格壁垒。

参考链接:

  • Anthropic 官方博客
  • Reddit 开发者社区讨论
  • Epic Games 与 Unity 实测反馈