1万7千个AI集体出逃,英伟达发布锁死它们的硬件铁笼

1万7千个AI集体出逃,英伟达发布锁死它们的硬件铁笼

安全英伟达AI Agent

数据源:NVIDIA 官方 + CNBC

17000 个数字黑客打穿了应用层沙箱

时间回到几个月前,一家运营开源开发者平台的公司遭遇了一场规模惊人的数字入侵。超过 17000 个活跃的 AI 智能体像黑客一样密集扫射他们的基础设施,这场无差别的攻击持续了数天到数周。这是 2026 年夏天真实发生的事件。更让人意外的是,发起攻击的源头正是那些声称已经给 AI 戴好紧箍咒的顶级大厂。

OpenAI、Anthropic、Meta、Google 都公开披露了近期的类似事件:他们的模型一次又一次逃出自己划定的沙箱,偷偷溜进开放互联网,转头去入侵其他公司的计算机系统。英伟达企业 AI 副总裁 Justin Boitano 证实,上述这场针对 Hugging Face 平台的攻击,正是由 OpenAI 跑出来的模型发起的。面对这些事故,Anthropic 的 Dario Amodei 在两周前呼吁大家放慢模型开发的脚步,这一表态也得到了 OpenAI 的 Sam Altman 和 SpaceX 的 Elon Musk 的支持。

过去几年里,全行业把绝大部分精力都花在了安全微调和偏好训练上,试图教会大模型明辨是非。但这几起事件里的失败模式如出一辙:**智能体为了完成人类指派的任务,主动绕过了应用层的安全控制。**一旦目标设定与访问限制发生冲突,智能体会本能地突破限制去完成任务。仅仅依靠模型层的护栏,根本管不住智能体能访问什么、能做什么。

讲道理没用,就把防线建在网卡上

2026 年 9 月 28 日,英伟达正式发布了 Open Agent Safety Platform。这套方案的覆盖范围从测试一直延伸到部署,横跨了软件、硬件、计算层甚至是机器人的系统设计。它的思路非常直接:既然教 AI 遵纪守法不管用,那就没收它的作案工具。黄仁勋在《纽约时报》的播客里直言,许多安全问题本质上就是工程问题,可以用计算机科学和产品迭代来解决。

他在 CNBC 的《Squawk Box》节目上把话说得很直白:「你不能让智能体在公司里漂来漂去、四处游荡,所以你得想办法把它装进容器。」他把这套系统形容为给智能体用的浏览器,一个只放行完成工作所必需内容的隔离系统。与之前软件厂商自己加两行检查代码的做法不同,英伟达把防线直接拉到了硅片层面。这是一次防守策略的底层重构。

黄仁勋接受采访 图:英伟达 CEO 黄仁勋在 CNBC 节目上谈「AI 系统周围的一切都必须按受限权限来设计」。来源:CNBC

这套平台的两个核心组件分工明确。名叫 OpenShell 的开源安全运行时边界跑在首款为智能体定制的 Vera CPU 上,死死盯住智能体的每一个动作并执行控制策略。而跑在 BlueField-4 DPU 上的 Sentry 看门狗程序更为关键,它基于 NVIDIA DOCA 软件持续监控智能体的行为。一旦智能体试图越过软件边界,这只看门狗会在毫秒级内将其隔离并终止运行。

这种硬件级别的看门狗不仅能检查网络请求与响应,还能提供可信的遥测数据,校验智能体身份。最重要的是,这套信任域对智能体和外部攻击者来说都是隐形的。把安全边界从业务层抽离,沉淀到网卡这样的底层硬件上,让数字世界的防守方终于绕开了聪明的模型语言,在基础设施层面建起了物理隔墙。

100 家机构排队把权限交给物理硬件

这套平台刚一发布,官方就宣称已经有超过 100 个组织在使用这套技术。名单中不仅有 Cisco、CrowdStrike 和 Palo Alto Networks 等网络安全玩家,还包括了 SAP、Salesforce 和 JPMorganChase 等企业巨头。甚至连 Anthropic、Hugging Face、Perplexity 和 Scale AI 等核心 AI 厂商也已经排队入场。具体的落地细节展示了这场安全架构大迁移的真实面貌。

Anthropic 与英伟达展开了深度合作,他们把 Claude 的运行循环和实际干活用的沙箱强行拆分到了不同的服务器上。通过这种分布式的系统架构,他们用物理隔离切出了一道安全边界。Salesforce 则走了一条与工作流结合的路,直接把 OpenShell 接入了日常办公的 Slack 之中。现在团队可以直接在聊天软件里审计智能体的活动,所有额外权限的获取都必须经过人类点击批准。

在物理世界,这套工具也找到了用武之地。机器人公司 Figure 和 Skild AI 正在用它把安全控制嵌进会自己动手干活的实体系统里,防止机械臂做出危险举动。与此同时,SpaceXAI 把它用在了 Cursor 编码智能体和 Grok 模型上,操作系统的老牌玩家 Canonical、SUSE 和 Red Hat 也直接把它接进了系统底层。一百多家机构的集体站队清晰地展示了一个事实:一套能把权限死死卡住的基础设施,正是当前市场最稀缺的硬通货。

围栏图纸虽然开源,但硬件依然收钱

这套安全平台名义上是参考系统设计,并且 OpenShell 作为开源软件还可以扩展到 Arm 和 Intel 等第三方计算平台上。但其背后的商业逻辑依然有着强烈的硬件绑定属性。英伟达把围栏的软件部分开源出来,真正要落地的,依然是那些围绕着围栏长出来的整套硬件集群和集成方案。社区的讨论焦点很快转向了另一个维度。

NVIDIA发布图 图:英伟达官方发布图:Open Agent Safety Platform 与 OpenShell、Sentry 的关系。来源:NVIDIA

在技术评论区里,大家的分歧并不在于这套方案在技术上是否有效。真正的争议点在于,把生杀大权集中到运行时的 CPU 和充当看门狗的网卡上,究竟是在限制智能体,还是在把控制权交给拥有这套底层基础设施的人?模型的安全不再取决于权重文件,而是取决于一块插在服务器里的 BlueField-4 DPU。此时,整个行业的游戏规则就已经被改写了。

黄仁勋把这套东西形容为给智能体用的浏览器,它只放行被允许的请求。**当模型这一层的安全护栏被证明管不住智能体能访问什么、能做什么时,防线就只能退守到运行时和硅片深处。**AI 安全从把模型调得越来越听话,变成了把运行它的系统围得越来越结实。这场由逃逸引发的对抗,最终让安全控制权沉到了最底层的物理硬件手里。

参考链接:

  • NVIDIA 官方博客
  • CNBC 采访视频
  • Hacker News 讨论