6 月的一个周五下午 5 点 21 分,Anthropic 因某国一纸出口禁令,关闭了 Claude Fable 5 对所有外国用户的访问。没有预警,没有缓冲,没有替代方案。所有基于这个模型构建的系统在同一时刻沉默了。这个事件没有出现在 Mozilla 7 月 14 日发布的《State of Open Source AI》报告正文中,但它像一条暗线贯穿了全部 59 页——所有权是一个工程决策,包装在哲学外衣里。
Mozilla 这份首期报告用 950+ 开发者的问卷数据和大量公开指标描绘了一幅复杂的图景:开源 AI 在能力上追到了差 3.3% 的位置,在成本上把推理价格打了 50 倍折扣,在 token 流量上拿下了 OpenRouter 的多数份额。但收入只有 4%,生产部署率比闭源低 12 个百分点,而且最关键的一层——agentic harness——至今没有开源方案的席位。
差距账:3.3% 的平均数藏着什么
报告用 Chatbot Arena 的数据画了一条 24 个月的追踪线:2024 年 1 月,开源与闭源前沿的 Elo 差距是 8.04%;到 2024 年 8 月,这个数字塌缩到了 0.5%;2025 年 2 月,DeepSeek-R1 短暂追平了美国最强模型;到 2026 年 3 月,差距重新拉开到 3.3%。

3.3% 这个数字本身更像一个平均值,而非战场实况。报告明确标注了「jagged frontier」——在不同能力维度上,开源和闭源各自占据高地:
| 能力维度 | 开源 vs 闭源 | 实际差距 |
|---|---|---|
| 代码生成 | 开源持平或领先 | 差距可忽略 |
| 指令遵循 | 开源持平 | 差距可忽略 |
| 通用知识 | 开源持平 | 差距可忽略 |
| 推理能力 | 闭源领先 | 差距集中在此 |
| 长上下文检索 | 闭源领先 | Gemini 3 在 1M token 多针检索上 89% vs DeepSeek V4-Pro 41% |
| Agentic 任务 | 闭源领先 | Terminal-Bench 验证级顶 tier 无开源模型 |
工程判断很直接:如果你的工作负载是代码生成和知识问答,开源模型已经没有妥协的价值。如果你是做复杂推理链或多步 agent 编排,闭源仍然有一道不窄的护城河。
成本账:50× 的衰减曲线改写采购逻辑
报告引用的推理成本数据来自 Stanford HAI AI Index、Epoch AI 和 MIT 的多项研究。GPT-4 级别的推理单价从 2022 年底的 $20/百万 token 跌到了 2025 年底的 $0.40——36 个月内 50 倍的降幅,比 dotcom 时代的带宽价格曲线和 PC 时代的算力价格曲线都要陡峭。

这个降幅正在改变大企业的算账方式。报告列举了三个案例:
- 微软:计划在 2026 年 6 月 30 日前取消大部分 Claude Code 许可证,因为 token 计费模式在几个月内就耗尽了年度 AI 预算。同时正在探索在 Azure 上托管 DeepSeek V4 来支撑最重的 Copilot 负载。
- Uber:在四个月内花光了全年 AI 编码预算,随后将每名员工的工具支出上限卡在 $1,500/月。
- Stripe:走了相反的路——将推理迁移到 vLLM 上自托管开源模型,同样的每天 5000 万次 API 调用,GPU 机群缩减到三分之一,推理成本下降 73%。
开源自托管把一笔按量计费、供应商控制的运营支出,转换成了企业自己拥有的固定成本。这不是技术选择,是 CFO 拿到报价单之后的必然计算。
流量账:谁在真正跑 token
OpenRouter 的数据给出了一个清晰的信号。报告显示,到 2026 年中,OpenRouter 上超过半数的 token 流量通过开源权重模型。按 token 量排名,前五全是开源模型:
| 排名 | 模型 | 来源 | 类型 | 月均 Token 量 |
|---|---|---|---|---|
| 1 | DeepSeek V4 Flash | DeepSeek(中国) | 开源 | 18.4T |
| 2 | MiMo-V2.5 | 小米(中国) | 开源 | 14.9T |
| 3 | Hy3 preview | 腾讯(中国) | 开源 | 14.8T |
| 4 | MiniMax M3 | MiniMax(中国) | 开源 | 14.3T |
| 5 | Owl Alpha | 未公开来源 | 开源 | 11T |
| 6 | Claude Opus 4.7 | Anthropic(美国) | 闭源 | 9.02T |
FT 的分析进一步量化了中美的体量差异:前九大模型中,中国模型每周约 18T token,美国模型约 5.5T,超过 3:1。开发者按成本路由流量,流量就流向开源。
但同时存在一个尖锐的收入不对称:在 2025 年 5-9 月的窗口里,闭源模型拿走了 OpenRouter 约 96% 的模型层收入,却只占约 80% 的使用量。Linux Foundation 的 Nagle-Yue 研究估算,按每次调用约 6 倍的价格差距计算,企业如果全部切换到开源,每年可节省约 $248 亿。开源在数量上赢了,在收钱这件事上还没开始。
部署账:79% 在用,51% 上线
Mozilla 联合 SlashData 的开发者调查揭露了一个更具体的矛盾。79% 的开发者在应用中使用了开源模型,71% 使用了闭源模型,50% 两者都用。 开源在采纳率上领先,但生产部署率倒挂:开源只有 51% 的团队进入生产环境,闭源是 63%。
这 12 个百分点的差距不是模型能力问题。拆分流失原因后,报告给出了清晰的归因:
| 挑战类别 | 流失组 vs 在用组差距 | 性质 |
|---|---|---|
| 模型性能不够好 | +12pp | 能力感知 |
| 集成到现有系统 | +11pp | 操作层 |
| 持续维护与更新 | +10pp | 操作层 |
| 文档不足 | +8pp | 操作层 |
| 部署、托管、扩展 | +8pp | 操作层 |
| 评估/比较模型 | +8pp | 操作层 |
| 安全、隐私、合规 | 0pp | 持平 |
| 专业支持缺乏 | -2pp | 逆向(在用组更高) |
五个最大的流失驱动因素中,四个是操作性问题。更值得关注的是按公司规模的部署率变化:闭源从小公司(2-50 人)的 54% 爬升到大型企业(1001+ 人)的 73%,一路走高。开源从 53% 到 57%,基本走平。企业可以靠预算砸穿闭源的部署门槛,但开源的部署工具链还没有人完成。
SlashData 的 Álvaro Ruiz Cubero 的总结是:「这个差距指向缺失的基础设施,部署率几乎不随公司规模增长,指向成熟工具和支持的缺乏。同时采购方正在优先考虑许可条款(31%)和数据所有权(26%),这意味着控制权和灵活性正在取代原始能力成为决策重心。」
地缘账:开源是策略,不是价值观
报告中最有信息量的一个板块是第三节——「为什么这件事无处不在」。70 多个国家有活跃的 AI 战略,47 个国家限制关键工作负载的境外数据处理。开源在这个语境下是主权选择。
Hugging Face 的累计下载数据给出了一个冷暖自知的画面:阿里的 Qwen 系列达到 9.42 亿次下载,Meta 的 Llama 系列 4.76 亿次。2026 年 2 月,Qwen 的单月下载量超过了其后八家组织之和。在 OpenRouter 上,中国开源模型的周 token 流量从 2024 年底的不到 2% 增长到 2026 年 4 月的 45% 以上,前十模型中约 61% 的流量来自中国模型。
这不是偶然。国务院 2025 年 8 月的「AI Plus」倡议和 2026 年 3 月的国家五年规划,将开源扩散写入核心指令。报告直接点出了一个结构性解释:发布公开权重本身是对半导体出口管制的宏观对冲——把全球推理负载转移到终端用户自己的硬件上。DeepSeek 报告了 26,000+ 企业账户,2025 年 58% 的新 AI 创业公司将其纳入技术栈,即便至少有八个司法管辖区限制其托管服务。企业的解法很工程化:禁掉托管 App,拿走权重自己部署。
主权 AI 的资金也在加速。欧盟通过 InvestAI 调集了 €2000 亿,其中 €200 亿公共资金用于建设 4-5 座 AI 超级工厂,并且直接资助 EUROPA——一个覆盖 24 种官方语言的 400B 参数开源模型。加拿大投入 $8.9 亿,印度采购了 38,231 块 GPU。法国为 Mistral 系列提供了 €1090 亿的公共与战略资本。

栈的成熟度:能力跑赢了操作
报告的第二节对开源 AI 技术栈做了 9 层 48 个组件的成熟度评分。整体画面是:上层框架能力充足,底层基础设施仍然是闭源的天下。
得分最高的组件:ML 框架(PyTorch、TensorFlow、Transformers)拿到 4.6/5,标注为「开源独有」;代码推理引擎(vLLM、llama.cpp、Ollama)拿到 4.3/5。最弱的:硬件芯片 2.1/5、数据集许可证 2.3/5、安全治理 2.1/5、权限模型 1.7/5。
两个最冷的评分维度贯穿了所有 9 层:标准化和企业就绪度。这就是前面那 12 个百分点部署差距的技术根源。开源生态在写模型这件事上已经很强,在把模型变成一个可信赖的产品这件事上还有大量工程没做。
商业账:钱已经在流动
报告第三章列出了开源 AI 生态的商业数据。Databricks 达到了 $54 亿的年化营收运转率;Mistral 在 12 个月内增长了 20 倍到约 $4 亿 ARR;DeepSeek 约 $2.2 亿 ARR,最近以 $74 亿融资、估值超过 $500 亿。五类收入模式已被证明可规模化:托管推理、企业平台、本地部署许可、微调服务和 harness 工具。
一个值得注意的转折信号来自 Zhipu AI 和 MiniMax——两家中国开源模型公司在 2026 年先后完成香港 IPO。开源 AI 生态已经从拨款阶段走到了风投阶段,现在跨入了公开市场。这不是一个靠理想主义维持的运动,是一个正在资本化的产业。
Harness:模型之上那层才是真正的战场
报告最核心的判断在第五节。模型层正在被商品化——报告直白地称之为「commoditizing toward zero」——价值正在向上移动到 agentic harness:编排循环、工具、记忆、沙箱、权限模型。
一个关键数据点来自 Terminal-Bench 2.0(2026 年 5 月)到 2.1(2026 年 7 月)的转变。在 2.0 版本中,第三方独立 harness 在 Anthropic 的权重上跑到了 79.8% 的得分,而 Anthropic 自家的 Claude Code 只有 58.0%,差距 21.8 个百分点。到 2.1 版本——仅仅八周后——各家前沿实验室已经把 harness 收紧到了自己的权重里。验证级顶 tier 中完全没有开源模型的身影。在一个中立的 vals.ai Terminus-2 跑分中,最强开源模型 GLM 5.2 拿到了 67.8%,落后 Claude Opus 4.8 约四个百分点,但每个任务成本是 $0.43 vs $2.41——能力差 4 个点,价格差 5 倍。
报告的判断是冷硬的:一个与开源权重协同设计的开源 harness 还没有被造出来。闭源实验室正在将模型和 scaffold 焊接成单一产品。窗口正在关闭,而且关得足够慢,让人可以假装它不存在。
五个下注方向
报告最后给出了五个不需要击败前沿就能执行的方向:
- 构建与开源权重协同设计的开源 harness:类比 Codex CLI 针对 GPT-5.5 的调优方式,做通用或垂直领域的版本。窗口期以月计,不是年。
- 拥有记忆层:当权重朝零定价,记忆成为唯一可复利的资产。用可移植的 append-only 格式存在自己的防火墙后面。
- 解决可移植权限:harness 的中央缺口是 write surface——没有跨 MCP host、A2A peer、直接工具调用和框架边界的可移植权限标准。基础设施已经进来了(10,000+ 服务器,9700 万月下载量),锁还没装上。
- 打破按量计费:当前前沿 API 定价处于「廉价打车时代」,陷阱相同。在负载可预测的地方自托管,留一个备选模型保持热备。
- 让开源默认是多元的:一个单一起源的开源默认不是真正的开放。47 个国家限制境外处理,70+ 战略在运行。公共资金已经到位,供应方需要出现。
安全不是闭源的理由
报告在安全章节里有一句简洁的定性:闭源 API 提供的过滤、监控和撤销功能,都是 serving 层的功能。把权重保密本身不提供任何一项。同一套控制在 harness 层同样适用于自托管开源模型。2025 年 Anthropic、Microsoft、ServiceNow 和 Salesforce 全部遭受了 CVSS 9.3-9.4 级的授权失败攻击——全是闭源系统。NTIA 研究后建议美国政府「监控而非限制」开源权重。安全问题的投资方向是 harness,不需要租用闭源模型。
回到 6 月那个周五下午。供应商可以关掉一个模型。没有人能关掉已经在你机器上运行的副本。对一家公司而言,存在本地的权重文件是一个对冲。对一个国家而言,它们的差别是政策和申请许可之间的差别。Mozilla 这份报告的核心论点不是开源更好,是开源让你有权利说不。租来的模型里没有这个选项。
本文的素材来自公开信息和社区讨论。如果你对这个话题有更深入的一手经验,欢迎指出文中的不足。
参考链接:
- Mozilla:2026 State of Open Source AI 报告
- Linux Foundation(Nagle-Yue 研究):开源模型收入与部署分析
- Stanford HAI AI Index / Epoch AI:推理成本趋势
- Financial Times:中美开源模型 token 流量对比
- Hugging Face:Qwen 与 Llama 下载量数据
- Anthropic / Microsoft / ServiceNow / Salesforce CVSS 9.3-9.4 安全事件汇总
- NTIA:开源权重安全建议报告