2026 年 9 月 1 日,Anthropic 将同一个底层模型分身成两个产品发布。公开版的 Claude Fable 5.1 典型负载降价约 25%,而满血版的 Mythos 5.1 直接加上了政审批准限制。全世界最好的科学推理模型,普通人拿着钱也买不到。
科学测试得分直接翻倍
Anthropic 释放了他们在长程复杂任务上的最新积累。在 Terminal-Bench-Science 基准中,Fable 5.1 拿下了 52.6% 的得分,比上一代直接翻倍。带有工具的 Humanity’s Last Exam 测试达到 65.0%,CursorBench 达到 73.4%。模型在长轴线任务上的跟进能力跨越了可用性门槛。
| 基准测试 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| 科研智能(Terminal-Bench-Science) | 52.6% | 24.7% | 29.0% | 22.4% |
| 编程智能(Terminal-Bench 4.0) | 55.8% | 42.0% | 52.3% | 37.3% |
| 通用知识(Humanity’s Last Exam) | 65.0% | 63.8% | 63.6% | — |
| 办公流程(AutomationBench) | 31.4% | 17.1% | 26.9% | 19.6% |
上一代模型在科学任务上的得分只有 24.7%,这一代直接翻了一倍多。差距最大的是办公自动化:上一代 17.1%,这代 31.4%,几乎翻倍。
Jane Street 量化研究主管 Craig Falls 的观察验证了基准测试数据。他发现 Fable 5.1 在多步长任务中始终保持代码可读性。长程代理工作流以前跑几个小时就会陷入死胡同,现在模型不仅能跟上节奏,还能在交易直觉上触及前沿水准。
图:Anthropic 发布页主视觉。来源:Anthropic
长程代理挤下 45% 成本水分
更强的模型在公开市场变得更便宜。Fable 5.1 在典型负载下按 token 计费降价 25%,在高度依赖缓存读取的 Agentic 工作流中,成本降幅达到 45%。基准定价保持输入 10 美元、输出 50 美元每百万 token,降价全部通过优化内部缓存调度实现。缓存读取效率决定了长程代理的商业可行性。
Ramp 直接让 Fable 5.1 无人值守跑了 38 小时机器学习任务。模型诊断出之前的结果是标签伪影,自动修正后开出 6 个并行实验通宵跑完。推理成本的大幅下探,让这种长达两天的无人值守试错成为普遍的工程常态。
图:Fable 5.1 性能对比图表。来源:Anthropic
拆解底层库找出陈年漏洞
安全护栏的误报率在这代模型上下降了 60%。Fable 5.1 被允许用于发现软件漏洞,底线是不能写利用程序。放宽静态扫描的安全红线直接释放了模型的逆向工程能力。
投资机构 Millennium 的内部系统有一个挂了几年都没人能解的罕见崩溃。Fable 5.1 通过反汇编第三方库,对照 core dump 文件,直接找出了内存泄漏的原因。模型不再是只能做上层封装的文字玩具,它可以毫无障碍地下探到二进制指令集。
配合秋季上线的 EFS(企业前沿安全护栏)系统,数据将被存放在客户独占的云基础设施中,实现物理层面的零数据留存。金融机构敢把核心底层代码直接扔给模型去跑。
准入资格锁死最强算力
最核心的转变是交付形态。Mythos 5.1 和 Fable 5.1 是同一个模型,唯一的区别是安全护栏等级。Mythos 5.1 面向网络安全与生命科学领域,它没有公开 API,其生物能力的访问项目由美国政府合作开发。
科学家注册系统即将开放,但这套审批流程划定了清晰的能力界限。在 Terminal-Bench 4.0 测试中,Mythos 拿到 60.9%,高于 Fable 的 55.8%。多出来的这 5% 性能,被严格封锁在合作名单的高墙之内。
Claude 5.1 的发布是一次明确的分野。前沿 AI 的顶配版本不再是一手交钱一手交货的商品,它变成了需要资质和审查的特许工具。普通开发者能买到越来越便宜的降级版,但通向顶层能力的直达梯,已经被悄然抽走。
参考链接:
- Anthropic 官方发布
- HN 讨论