开源 AI 的账本:Mozilla 2026 现状报告解读

开源 AI 的账本:Mozilla 2026 现状报告解读

AI开源LLM许可证社区地缘政治

数据源:HN + Lobsters

6 月的一个周五下午 5 点 21 分,Anthropic 因某国一纸出口禁令,关闭了 Claude Fable 5 对所有外国用户的访问。没有预警,没有缓冲,没有替代方案。所有基于这个模型构建的系统在同一时刻沉默了。这个事件没有出现在 Mozilla 7 月 14 日发布的《State of Open Source AI》报告正文中,但它像一条暗线贯穿了全部 59 页——所有权是一个工程决策,包装在哲学外衣里。

Mozilla 这份首期报告用 950+ 开发者的问卷数据和大量公开指标描绘了一幅复杂的图景:开源 AI 在能力上追到了差 3.3% 的位置,在成本上把推理价格打了 50 倍折扣,在 token 流量上拿下了 OpenRouter 的多数份额。但收入只有 4%,生产部署率比闭源低 12 个百分点,而且最关键的一层——agentic harness——至今没有开源方案的席位。

差距账:3.3% 的平均数藏着什么

报告用 Chatbot Arena 的数据画了一条 24 个月的追踪线:2024 年 1 月,开源与闭源前沿的 Elo 差距是 8.04%;到 2024 年 8 月,这个数字塌缩到了 0.5%;2025 年 2 月,DeepSeek-R1 短暂追平了美国最强模型;到 2026 年 3 月,差距重新拉开到 3.3%。

开源 AI 报告封面页

3.3% 这个数字本身更像一个平均值,而非战场实况。报告明确标注了「jagged frontier」——在不同能力维度上,开源和闭源各自占据高地:

能力维度开源 vs 闭源实际差距
代码生成开源持平或领先差距可忽略
指令遵循开源持平差距可忽略
通用知识开源持平差距可忽略
推理能力闭源领先差距集中在此
长上下文检索闭源领先Gemini 3 在 1M token 多针检索上 89% vs DeepSeek V4-Pro 41%
Agentic 任务闭源领先Terminal-Bench 验证级顶 tier 无开源模型

工程判断很直接:如果你的工作负载是代码生成和知识问答,开源模型已经没有妥协的价值。如果你是做复杂推理链或多步 agent 编排,闭源仍然有一道不窄的护城河。

成本账:50× 的衰减曲线改写采购逻辑

报告引用的推理成本数据来自 Stanford HAI AI Index、Epoch AI 和 MIT 的多项研究。GPT-4 级别的推理单价从 2022 年底的 $20/百万 token 跌到了 2025 年底的 $0.40——36 个月内 50 倍的降幅,比 dotcom 时代的带宽价格曲线和 PC 时代的算力价格曲线都要陡峭。

报告图表页

这个降幅正在改变大企业的算账方式。报告列举了三个案例:

  • 微软:计划在 2026 年 6 月 30 日前取消大部分 Claude Code 许可证,因为 token 计费模式在几个月内就耗尽了年度 AI 预算。同时正在探索在 Azure 上托管 DeepSeek V4 来支撑最重的 Copilot 负载。
  • Uber:在四个月内花光了全年 AI 编码预算,随后将每名员工的工具支出上限卡在 $1,500/月。
  • Stripe:走了相反的路——将推理迁移到 vLLM 上自托管开源模型,同样的每天 5000 万次 API 调用,GPU 机群缩减到三分之一,推理成本下降 73%。

开源自托管把一笔按量计费、供应商控制的运营支出,转换成了企业自己拥有的固定成本。这不是技术选择,是 CFO 拿到报价单之后的必然计算。

流量账:谁在真正跑 token

OpenRouter 的数据给出了一个清晰的信号。报告显示,到 2026 年中,OpenRouter 上超过半数的 token 流量通过开源权重模型。按 token 量排名,前五全是开源模型:

排名模型来源类型月均 Token 量
1DeepSeek V4 FlashDeepSeek(中国)开源18.4T
2MiMo-V2.5小米(中国)开源14.9T
3Hy3 preview腾讯(中国)开源14.8T
4MiniMax M3MiniMax(中国)开源14.3T
5Owl Alpha未公开来源开源11T
6Claude Opus 4.7Anthropic(美国)闭源9.02T

FT 的分析进一步量化了中美的体量差异:前九大模型中,中国模型每周约 18T token,美国模型约 5.5T,超过 3:1。开发者按成本路由流量,流量就流向开源。

但同时存在一个尖锐的收入不对称:在 2025 年 5-9 月的窗口里,闭源模型拿走了 OpenRouter 约 96% 的模型层收入,却只占约 80% 的使用量。Linux Foundation 的 Nagle-Yue 研究估算,按每次调用约 6 倍的价格差距计算,企业如果全部切换到开源,每年可节省约 $248 亿。开源在数量上赢了,在收钱这件事上还没开始。

部署账:79% 在用,51% 上线

Mozilla 联合 SlashData 的开发者调查揭露了一个更具体的矛盾。79% 的开发者在应用中使用了开源模型,71% 使用了闭源模型,50% 两者都用。 开源在采纳率上领先,但生产部署率倒挂:开源只有 51% 的团队进入生产环境,闭源是 63%。

这 12 个百分点的差距不是模型能力问题。拆分流失原因后,报告给出了清晰的归因:

挑战类别流失组 vs 在用组差距性质
模型性能不够好+12pp能力感知
集成到现有系统+11pp操作层
持续维护与更新+10pp操作层
文档不足+8pp操作层
部署、托管、扩展+8pp操作层
评估/比较模型+8pp操作层
安全、隐私、合规0pp持平
专业支持缺乏-2pp逆向(在用组更高)

五个最大的流失驱动因素中,四个是操作性问题。更值得关注的是按公司规模的部署率变化:闭源从小公司(2-50 人)的 54% 爬升到大型企业(1001+ 人)的 73%,一路走高。开源从 53% 到 57%,基本走平。企业可以靠预算砸穿闭源的部署门槛,但开源的部署工具链还没有人完成。

SlashData 的 Álvaro Ruiz Cubero 的总结是:「这个差距指向缺失的基础设施,部署率几乎不随公司规模增长,指向成熟工具和支持的缺乏。同时采购方正在优先考虑许可条款(31%)和数据所有权(26%),这意味着控制权和灵活性正在取代原始能力成为决策重心。」

地缘账:开源是策略,不是价值观

报告中最有信息量的一个板块是第三节——「为什么这件事无处不在」。70 多个国家有活跃的 AI 战略,47 个国家限制关键工作负载的境外数据处理。开源在这个语境下是主权选择。

Hugging Face 的累计下载数据给出了一个冷暖自知的画面:阿里的 Qwen 系列达到 9.42 亿次下载,Meta 的 Llama 系列 4.76 亿次。2026 年 2 月,Qwen 的单月下载量超过了其后八家组织之和。在 OpenRouter 上,中国开源模型的周 token 流量从 2024 年底的不到 2% 增长到 2026 年 4 月的 45% 以上,前十模型中约 61% 的流量来自中国模型。

这不是偶然。国务院 2025 年 8 月的「AI Plus」倡议和 2026 年 3 月的国家五年规划,将开源扩散写入核心指令。报告直接点出了一个结构性解释:发布公开权重本身是对半导体出口管制的宏观对冲——把全球推理负载转移到终端用户自己的硬件上。DeepSeek 报告了 26,000+ 企业账户,2025 年 58% 的新 AI 创业公司将其纳入技术栈,即便至少有八个司法管辖区限制其托管服务。企业的解法很工程化:禁掉托管 App,拿走权重自己部署。

主权 AI 的资金也在加速。欧盟通过 InvestAI 调集了 €2000 亿,其中 €200 亿公共资金用于建设 4-5 座 AI 超级工厂,并且直接资助 EUROPA——一个覆盖 24 种官方语言的 400B 参数开源模型。加拿大投入 $8.9 亿,印度采购了 38,231 块 GPU。法国为 Mistral 系列提供了 €1090 亿的公共与战略资本。

报告图表页 3

栈的成熟度:能力跑赢了操作

报告的第二节对开源 AI 技术栈做了 9 层 48 个组件的成熟度评分。整体画面是:上层框架能力充足,底层基础设施仍然是闭源的天下。

得分最高的组件:ML 框架(PyTorch、TensorFlow、Transformers)拿到 4.6/5,标注为「开源独有」;代码推理引擎(vLLM、llama.cpp、Ollama)拿到 4.3/5。最弱的:硬件芯片 2.1/5、数据集许可证 2.3/5、安全治理 2.1/5、权限模型 1.7/5。

两个最冷的评分维度贯穿了所有 9 层:标准化企业就绪度。这就是前面那 12 个百分点部署差距的技术根源。开源生态在写模型这件事上已经很强,在把模型变成一个可信赖的产品这件事上还有大量工程没做。

商业账:钱已经在流动

报告第三章列出了开源 AI 生态的商业数据。Databricks 达到了 $54 亿的年化营收运转率;Mistral 在 12 个月内增长了 20 倍到约 $4 亿 ARR;DeepSeek 约 $2.2 亿 ARR,最近以 $74 亿融资、估值超过 $500 亿。五类收入模式已被证明可规模化:托管推理、企业平台、本地部署许可、微调服务和 harness 工具。

一个值得注意的转折信号来自 Zhipu AI 和 MiniMax——两家中国开源模型公司在 2026 年先后完成香港 IPO。开源 AI 生态已经从拨款阶段走到了风投阶段,现在跨入了公开市场。这不是一个靠理想主义维持的运动,是一个正在资本化的产业。

Harness:模型之上那层才是真正的战场

报告最核心的判断在第五节。模型层正在被商品化——报告直白地称之为「commoditizing toward zero」——价值正在向上移动到 agentic harness:编排循环、工具、记忆、沙箱、权限模型。

一个关键数据点来自 Terminal-Bench 2.0(2026 年 5 月)到 2.1(2026 年 7 月)的转变。在 2.0 版本中,第三方独立 harness 在 Anthropic 的权重上跑到了 79.8% 的得分,而 Anthropic 自家的 Claude Code 只有 58.0%,差距 21.8 个百分点。到 2.1 版本——仅仅八周后——各家前沿实验室已经把 harness 收紧到了自己的权重里。验证级顶 tier 中完全没有开源模型的身影。在一个中立的 vals.ai Terminus-2 跑分中,最强开源模型 GLM 5.2 拿到了 67.8%,落后 Claude Opus 4.8 约四个百分点,但每个任务成本是 $0.43 vs $2.41——能力差 4 个点,价格差 5 倍。

报告的判断是冷硬的:一个与开源权重协同设计的开源 harness 还没有被造出来。闭源实验室正在将模型和 scaffold 焊接成单一产品。窗口正在关闭,而且关得足够慢,让人可以假装它不存在。

五个下注方向

报告最后给出了五个不需要击败前沿就能执行的方向:

  1. 构建与开源权重协同设计的开源 harness:类比 Codex CLI 针对 GPT-5.5 的调优方式,做通用或垂直领域的版本。窗口期以月计,不是年。
  2. 拥有记忆层:当权重朝零定价,记忆成为唯一可复利的资产。用可移植的 append-only 格式存在自己的防火墙后面。
  3. 解决可移植权限:harness 的中央缺口是 write surface——没有跨 MCP host、A2A peer、直接工具调用和框架边界的可移植权限标准。基础设施已经进来了(10,000+ 服务器,9700 万月下载量),锁还没装上。
  4. 打破按量计费:当前前沿 API 定价处于「廉价打车时代」,陷阱相同。在负载可预测的地方自托管,留一个备选模型保持热备。
  5. 让开源默认是多元的:一个单一起源的开源默认不是真正的开放。47 个国家限制境外处理,70+ 战略在运行。公共资金已经到位,供应方需要出现。

安全不是闭源的理由

报告在安全章节里有一句简洁的定性:闭源 API 提供的过滤、监控和撤销功能,都是 serving 层的功能。把权重保密本身不提供任何一项。同一套控制在 harness 层同样适用于自托管开源模型。2025 年 Anthropic、Microsoft、ServiceNow 和 Salesforce 全部遭受了 CVSS 9.3-9.4 级的授权失败攻击——全是闭源系统。NTIA 研究后建议美国政府「监控而非限制」开源权重。安全问题的投资方向是 harness,不需要租用闭源模型。

回到 6 月那个周五下午。供应商可以关掉一个模型。没有人能关掉已经在你机器上运行的副本。对一家公司而言,存在本地的权重文件是一个对冲。对一个国家而言,它们的差别是政策和申请许可之间的差别。Mozilla 这份报告的核心论点不是开源更好,是开源让你有权利说不。租来的模型里没有这个选项。

本文的素材来自公开信息和社区讨论。如果你对这个话题有更深入的一手经验,欢迎指出文中的不足。

参考链接:

  • Mozilla:2026 State of Open Source AI 报告
  • Linux Foundation(Nagle-Yue 研究):开源模型收入与部署分析
  • Stanford HAI AI Index / Epoch AI:推理成本趋势
  • Financial Times:中美开源模型 token 流量对比
  • Hugging Face:Qwen 与 Llama 下载量数据
  • Anthropic / Microsoft / ServiceNow / Salesforce CVSS 9.3-9.4 安全事件汇总
  • NTIA:开源权重安全建议报告