9月22日的默契:不拼智商拼账单
2026 年 9 月 22 日,这个星球上研发模型最烧钱的两家公司,在同一天里不约而同地把自家最新产品砍价将近一半。Anthropic 推出的 Claude Opus 5.5 比前代便宜了四成,而 OpenAI 发布的 GPT-6 Sol 与 Luna 则在之前促销价的基础上再降百分之五十。这两份相隔不到几小时发布的公告里,能力跑分的篇幅被大幅压缩,取而代之的是密密麻麻的单价小数点。模型能力的绝对差距无法再像过去那样拉开代际身位,这两家前沿厂商只能把较量的筹码放到了算力定价表上。
这两家公司在同一天调价绝非偶然撞车,它反映了行业技术红利放缓后的必然防守。Anthropic 在发布 Opus 5.5 时用相当长的篇幅强调其输入与输出成本的降低,并直言在当前的能力水平上,基准测试的跑分差距已经不能真实反映模型的体验差异。这种坦诚背后隐藏的事实是新架构无法在智力上甩开对手一条街,厂商只能在算力使用费上断掉对手的后路。OpenAI 的策略同样直白,GPT-6 的 Sol 和 Luna 版本沿用了上一代将高阶智能下放的路线,他们把最强模型的名号留给 Astra,同时将走量版本的价格压到了底线。
在过去两年里,每次有大版本号更新,开发者最关心的是它能在复杂的逻辑推理题上多拿几分,以及能看懂多长的文档。但现在模型发布会上的核心看点变成了每百万 token 的美分计价表,因为代码助手和自动化工作流在日常运转时,那些微小的跑分差异对成功率的贡献微乎其微。决定工程团队选择的基准已经转移。评测跑完后公司账户里的剩余余额,决定了开发者是否为这款模型买单。
Anthropic 砍掉代理任务 60% 成本
如果把视线从整体降幅移开,就会发现 Anthropic 此次降价有着精准的手术刀式目标。Opus 5.5 的常规输入价格从 5 美元降到了 4 美元,降幅为 20%,但缓存读取(Cache Read)的单价却大幅跳水了 60%,来到了每百万 token 仅需 0.20 美元。这种不对称的价格调整,实质上是在向重度使用长上下文缓存的编码代理开发者递交投名状。在真实的代码迁移和复杂代理任务中,模型需要反复读取同一个巨大的代码库上下文,缓存读取的费用占据了总账单的绝对大头。
图:Claude Opus 5.5 发布页主视觉。来源:Anthropic 官方发布页
有一位参与早期测试的开发者提到,他利用 Opus 5.5 在不到一天的时间内完成了 68 万行代码的跨框架迁移。如果按照传统的计费模型,这种规模的反复上下文拉取会让个人开发者直接破产,但现在的成本已经下探到了可以被独立黑客承受的区间。Anthropic 显然算过一笔账,用输入输出的温和降价稳住常规用户,用缓存读取的降价锁死那些真正把 AI 当成自动化劳动力来用的工程团队。针对特定计算特征的定向让利,比泛泛的全面降价更能刺痛竞争对手的现金流。
OpenAI 拿促销价做降价锚点
与 Anthropic 针对具体技术路径的降价不同,OpenAI 的定价把戏更多体现在财务包装的锚点上。GPT-6 Luna 的输入和输出价格分别定在了 0.10 和 0.50 美元,官方宣传口径宣称比 GPT-5.6 便宜了百分之五十。但仔细核对账单会发现,这个降幅的比较基准是 GPT-5.6 在某段时间内提供的特殊促销价,并非长期执行的官方指导标价。这种在价格比较上玩弄的话术,掩盖了 Luna 在模型能力上几乎没有任何实质性跃升的事实。
OpenAI 在发布稿中无意间透露的一组数据,反而成了暴露成本压力的关键线索。他们承认内部按照 API 价格折算,研究员每天消耗 token 的中位数达到了 600 美元,排名前 10% 的研究员每天的用量账单更是高达 7000 美元。内部人员对算力的这种吞噬速度,反证了自动化编程和大规模工程迭代对使用成本的极端敏感。在自家后院跑一遍流程都要花掉数千美元的情况下,对外售卖这种自动化能力时,厂商必须把标价压得足够低才能找到商业客户。
这两家公司的降价策略看似相似,但发力点存在显著差异。为了更直观地看懂它们的定价逻辑,我们可以对比一下其核心计费项上的具体参数:
| 模型 | 输入单价(每百万token) | 输出单价 | 缓存读取单价 | 定价基准点 |
|---|---|---|---|---|
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | 对比上一代常规标价 |
| GPT-6 Luna | $0.10 | $0.50 | 社区测算较高 | 对比促销期价格 |
| GPT-6 Sol | $2.00 | $10.00 | 未披露 | 对比促销期价格 |
这份表格清晰地展示了两家策略的不同。OpenAI 试图在绝对数字上保持更低的门槛,Anthropic 则是把降价的重心倾斜到了缓存这种高频调用的重资产上。
跑完一次评测烧掉 8708 美元
模型厂商试图用降价掩盖的另一个事实是,所谓的前沿智能早就成了普通人玩不起的昂贵游戏。Artificial Analysis 机构给 Opus 5.5 的智能指数打出了 58 分,它在 212 个主流模型中排名第一。但为了得到这个第一的成绩,评测机构在后台跑了 2.6 亿个 token,单次跑分直接烧掉了 8708.20 美元。作为对比,同类评测跑完一圈的 token 消耗中位数不过 8800 万,为了验证模型是否聪明,测试者需要先支付极高的算力账单。
图:NVIDIA DGX B200 服务器算力节点。来源:Wikimedia Commons,CC BY-SA 4.0
第三方机构现在不得不把「最聪明」和「每美元最聪明」拆成两个独立的榜单来发布,榜首的模型往往在成本排名里只能排到 90 名开外。发布稿里大肆宣扬的那点智力优势,是用远超同侪的输出规模和重试次数堆出来的。这种不对称的投入产出比表明,依靠暴力堆算力来拔高基准测试成绩的路径已经走到了经济账的死胡同。只要普通开发者无法在日常的几十美元账单里感受到这种智能溢价,榜单上的第一名就永远只是停留在大厂实验室里的特供展品。
降速呼吁成了另一场商业防御
在降价的背后,Anthropic 试图在行业叙事上抢占道德制高点,社区的反应却揭示了另一种商业算计。Opus 5.5 的发布稿开篇重提了那篇《我们必须给前沿降速》的文章,并宣布新模型强制携带了与 Fable 5.1 同等级别的安全栅栏。HN 社区上有人把 pacing the frontier 里的 pace 解释为赛车里的领航安全车,它的主要作用并非为了自己快,其目的是压住后面所有赛车的速度。Anthropic 完全可以自己在实验室里放慢脚步,他们却呼吁用全行业的强制框架来踩刹车。
将降价与高强度的合规约束捆绑在一起,是在用安全名义构筑新的防御掩体。因为生物学和网络安全能力的提升,Opus 5.5 的高阶功能需要验证研究机构的身份才能调用,厂商强制开启了防止蒸馏的保留思维模式。把合规门槛拉高,实质上是让那些试图借助开源模型快速追赶的竞争对手背上同样沉重的审计包袱。当模型在核心能力上挤不出牙膏时,利用行业规则制定权来拖慢对手,成了这场没有硝烟的战争中最后的竞争手段。
两家巨头选在同一天抛出降价方案,核心目的在于掩盖能力迭代停滞的现实。Anthropic 在缓存上的定向降价切实切中了工程团队的刚需,OpenAI 拿促销价做文章也成功保住了廉价的账面数字。但无论是 0.20 美元的缓存还是 0.10 美元的输入,都在指向同一个事实。当 2.6 亿 token 的堆砌才能换来榜单上的微小超越时,前沿模型的较量已经从技术突破退化成了成本精算。决定下一个赢家的要素,已经从发布会上宣扬的智能指数,变成了谁能让那些日耗六百美元的工程师们在跑完流水线后少看几次信用卡的账单预警。
参考链接:
- Claude Opus 5.5 官方发布稿
- GPT-6 Sol and Luna 官方发布稿
- Hacker News 社区讨论 (item?id=49803892)