Muse Spark 1.3 登顶 DeepSWE,API 价格打到一折

Muse Spark 1.3 登顶 DeepSWE,API 价格打到一折

AIMeta

数据源:HN + web research

DeepSWE 75.4,榜首一天两换

2026 年 9 月 2 日,Google 的 Gemini 3.8 Flash 刚登上 DeepSWE 榜首几个小时,Meta Superintelligence Labs 发布的 Muse Spark 1.3 就以 75.4 的分数把它挤了下去。同一天,Meta 在 Muse Code CLI 和 Meta Model API 同步上线了这个模型,「max reasoning」模式则因额外安全测试稍晚开放。

这个榜首争夺的节奏本身就说明了一件事:前沿编码模型的能力差距正在压缩到以小时计。但 Muse Spark 1.3 带来的更大冲击在价格表上。

12.5 倍价差,数据换折扣写进了价格表

Muse Spark 1.3 提供两个 API 档位,定价差距之大在同级模型中罕见:

档位输入($/Mtok)缓存输入($/Mtok)输出($/Mtok)
标准档$1.25$0.15$4.25
contributor 档$0.10$0.002$0.20
差价倍数12.5×75×21.25×

标准档的定价与 GPT-5.6 Sol 同一量级。contributor 档的输入价 $0.10/Mtok、输出价 $0.20/Mtok,对于一个刚刚拿下 DeepSWE 第一的模型来说,几乎是市场上最低的前沿级别价格。两个档位之间的唯一区别写在页面文案里:contributor 档注明「Used to improve our products」,标准档注明「Not used to improve our products」。

Meta 把原本藏在隐私政策深处的数据条款搬到了定价页的显眼位置。输出端 21 倍的差价意味着,一个中等规模的 agentic 编码任务(2 万 token 输出),标准档花费约 $0.085,contributor 档仅 $0.004。月调用量上万次的团队,年化成本差距可达数万美元。对爱好者和小团队来说,这个价差几乎构成了拒绝交出数据的经济门槛。

跑分矩阵:前代追赶者变成本代领跑者

Muse Spark 1.2 在社区的口碑是「快、便宜、够用,但算不上前沿」——OpenCode 上最好的免费模型之一,适合简单到中等任务。1.3 的跑分把这个定位翻了过来。

Muse Spark 1.3 官方 benchmark scorecard 图:Muse Spark 1.3 与 1.2、GPT-5.6 Sol、Opus 5 的基准对比。来源:Meta AI Research

官方 benchmark scorecard 覆盖 agentic、coding、instruction-following、long-context 四类评测。官方称 1.3 在多项基准上超越了 GPT-5.6 Sol(max)和 Opus 5(max),DeepSWE 75.4 是目前的最高分。不过官方报告也承认部分基准为较老或已饱和的测试集——HN 评论区对此有针对性的质疑。

simonw 的实测提供了一个可复现的侧写:用 llm -m meta-ai/muse-spark-1.3 生成 SVG,花费 4.2266 美分、耗时 38 秒,输出质量「明显优于 1.2」。他还测试了五个 reasoning 档位,确认高档位在复杂任务上的增益可感知。4 美分一次调用的成本,配合 DeepSWE 榜首级别的能力,构成了一个对独立开发者极具吸引力的性价比组合。

工程效率提升:少 20% 调用,少 25% token

官方给出的工程侧数据同样有信息量。相比 1.2,Meta 内部工程师实测 1.3 在长程编码任务中减少了约 20% 的 tool calls 和约 25% 的 token 消耗。模型自身的 token 效率直接影响 API 账单。25% 的 token 节省叠加 contributor 档的低单价,实际使用成本还会进一步拉开差距。

在 agentic 行为层面,1.3 的改进集中在三个方面:混乱上下文中正确映射打断和转向指令、执行不可逆动作前主动确认、对自身知识边界的校准更好(官方称「少幻觉硬编结果」)。多步指令保持力更强,不容易丢约束。这些改进指向同一个方向:降低人工干预频率。

GDPval 演示:从代码生成到文档交付

Muse Spark 1.3 的发布还附带了四个 GDPval(视觉感知 + 真实执行环境)演示,展示的能力已经超出了传统编码模型的边界:

GDPval 演示:X-wing 流场仿真报告 图:GDPval 演示中的 X-wing CFD 仿真报告封面页。来源:Meta AI Research

四个任务覆盖面很广:读 CFD 仿真结果和 STEP CAD 模型生成 PDF 报告、按时间码修混音轨道并导出 48kHz/24bit WAV、制作 PPT 商业提案、从 Excel 台账生成 PDF 摘要。官方强调这些演示「通过真实执行环境运行,非脚本步骤」。模型直接感知截图和视频片段后执行操作。

Meta 在把 Muse Spark 从「编码模型」推向「文档级 agent」。能读 CAD、能处理音频、能做 PPT——单项能力不算惊人,但整合到一个模型里、配合 contributor 档的价格,轻量级企业自动化工作流的成本会大幅降低。

社区争议:便宜在价格,贵在数据

contributor 定价在 HN 评论区引发了两极反应。

反对方的逻辑直接:finnjohnsen2 指出「便宜的那档是让我变成产品」;Gecko4072 提及 Meta 此前被裁定赔偿 180 亿美元精神健康诉讼,认为不想支持这家公司。这类反对并非技术层面的质疑,而是对 Meta 作为数据受托方的信任缺失。

支持方同样有论据:apodolny 认为「提供打折训练版 vs 全价版的区分看起来合理且透明」——至少 Meta 把数据条款放在了价格标签旁边,没有藏在 70 页的用户协议里。Lucasoato 的评论更戏谑:「几乎让我忘了 180 亿美元官司」。wxw 则提出一个更值得讨论的视角——「$0.10/$0.20 若能对标 Sol 级别,表明用户数据飞轮对 RL 与模型改进有多重要」。10 倍以上的价差不是善意折扣,它定量地反映了 Meta 对用户数据训练价值的估算。

基准饱和度是另一个争议焦点。jumploops 在评论中指出 Spark 1.3「在老的、饱和的基准上很能打」,暗示高分可能部分来自对旧题目的过拟合。scotty79 的观察更宏观:「人人都在逼近前沿,是不是进入了 sigmoid 的新段?」——如果所有模型都在 DeepSWE 上拿 70+,这个基准还能区分能力差异吗?

廉价前沿模型接力跑:榜首一天换了两次

把 Muse Spark 1.3 放到当天的市场背景中看,画面更清晰。同一天,Google Gemini 3.8 Flash 刚以「最便宜的 AI 跑分全场第一」登上站内头条,几个小时后就被 Meta 挤下了榜首。HN 评论区已经有人注意到 OpenAI「Astra」次日也有发布动作——fibonacci112358 的原话是「大家是不是都在 Astra 明天发布前抢跑?」

mromanuk 的使用经验提供了一个用户视角:1.2 在 web app 上犯过错,他转回了 Claude、Kimi K3 和 DeepSeek V4;「希望这代能解决 agentic 开发的问题」。1.3 的跑分提升是否能转化为实际使用中的可靠性,仍然需要更多社区实测来验证。

官方路线图还透露了两个预告:更大的模型正在路上,Muse Spark 的 open weights 开源权重版本即将发布。如果 contributor 档的低价已经让数据飞轮开始转动,开源权重的释出将进一步扩大 Meta 在数据获取上的漏斗——社区贡献的微调数据和 RLHF 反馈,本质上也是训练素材。

跑分登顶是入场券,数据定价才是底牌

Muse Spark 1.3 的 DeepSWE 75.4 证明了 Meta 在前沿编码能力上已经站到了第一梯队。但这个榜首可能维持不了几天——Gemini 3.8 Flash 保持了大半天,Spark 1.3 的窗口期也不会更长。跑分军备赛的节奏越来越像消费电子的参数内卷:领先幅度在缩小,保持时间在缩短。

真正区分 Meta 打法的是 contributor 定价。用 12.5 倍的输入价差和 21 倍的输出价差,把「用户数据换训练许可」从含糊的默认条款变成了一个带价格标签的选项。开发者第一次可以精确计算把数据交给 Meta 值多少钱——或者反过来说,不交数据的隐私溢价是多少。这张价格表比任何基准分数都更能说明 agentic 编码市场下一阶段的竞争逻辑。

参考链接:

  • Meta AI Research 发布博客
  • Hacker News 讨论帖