Claude新模型降价25%,最强版要政府放行

Claude新模型降价25%,最强版要政府放行

AIClaudeAnthropic

数据源:HN + web research

2026 年 9 月 1 日,Anthropic 将同一个底层模型分身成两个产品发布。公开版的 Claude Fable 5.1 典型负载降价约 25%,而满血版的 Mythos 5.1 直接加上了政审批准限制。全世界最好的科学推理模型,普通人拿着钱也买不到。

科学测试得分直接翻倍

Anthropic 释放了他们在长程复杂任务上的最新积累。在 Terminal-Bench-Science 基准中,Fable 5.1 拿下了 52.6% 的得分,比上一代直接翻倍。带有工具的 Humanity’s Last Exam 测试达到 65.0%,CursorBench 达到 73.4%。模型在长轴线任务上的跟进能力跨越了可用性门槛。

基准测试Fable 5.1Fable 5Opus 5GPT-5.6 Sol
科研智能(Terminal-Bench-Science)52.6%24.7%29.0%22.4%
编程智能(Terminal-Bench 4.0)55.8%42.0%52.3%37.3%
通用知识(Humanity’s Last Exam)65.0%63.8%63.6%
办公流程(AutomationBench)31.4%17.1%26.9%19.6%

上一代模型在科学任务上的得分只有 24.7%,这一代直接翻了一倍多。差距最大的是办公自动化:上一代 17.1%,这代 31.4%,几乎翻倍。

Jane Street 量化研究主管 Craig Falls 的观察验证了基准测试数据。他发现 Fable 5.1 在多步长任务中始终保持代码可读性。长程代理工作流以前跑几个小时就会陷入死胡同,现在模型不仅能跟上节奏,还能在交易直觉上触及前沿水准。

Anthropic 发布页主视觉 图:Anthropic 发布页主视觉。来源:Anthropic

长程代理挤下 45% 成本水分

更强的模型在公开市场变得更便宜。Fable 5.1 在典型负载下按 token 计费降价 25%,在高度依赖缓存读取的 Agentic 工作流中,成本降幅达到 45%。基准定价保持输入 10 美元、输出 50 美元每百万 token,降价全部通过优化内部缓存调度实现。缓存读取效率决定了长程代理的商业可行性。

Ramp 直接让 Fable 5.1 无人值守跑了 38 小时机器学习任务。模型诊断出之前的结果是标签伪影,自动修正后开出 6 个并行实验通宵跑完。推理成本的大幅下探,让这种长达两天的无人值守试错成为普遍的工程常态。

Fable 5.1 性能对比 图:Fable 5.1 性能对比图表。来源:Anthropic

拆解底层库找出陈年漏洞

安全护栏的误报率在这代模型上下降了 60%。Fable 5.1 被允许用于发现软件漏洞,底线是不能写利用程序。放宽静态扫描的安全红线直接释放了模型的逆向工程能力。

投资机构 Millennium 的内部系统有一个挂了几年都没人能解的罕见崩溃。Fable 5.1 通过反汇编第三方库,对照 core dump 文件,直接找出了内存泄漏的原因。模型不再是只能做上层封装的文字玩具,它可以毫无障碍地下探到二进制指令集。

配合秋季上线的 EFS(企业前沿安全护栏)系统,数据将被存放在客户独占的云基础设施中,实现物理层面的零数据留存。金融机构敢把核心底层代码直接扔给模型去跑。

准入资格锁死最强算力

最核心的转变是交付形态。Mythos 5.1 和 Fable 5.1 是同一个模型,唯一的区别是安全护栏等级。Mythos 5.1 面向网络安全与生命科学领域,它没有公开 API,其生物能力的访问项目由美国政府合作开发。

科学家注册系统即将开放,但这套审批流程划定了清晰的能力界限。在 Terminal-Bench 4.0 测试中,Mythos 拿到 60.9%,高于 Fable 的 55.8%。多出来的这 5% 性能,被严格封锁在合作名单的高墙之内。

Claude 5.1 的发布是一次明确的分野。前沿 AI 的顶配版本不再是一手交钱一手交货的商品,它变成了需要资质和审查的特许工具。普通开发者能买到越来越便宜的降级版,但通向顶层能力的直达梯,已经被悄然抽走。

参考链接:

  • Anthropic 官方发布
  • HN 讨论