2026 年 9 月,Anthropic 创始人 Dario Amodei 发布长文《We Must Pace the Frontier》,呼吁为前沿 AI 的狂飙突进踩一脚刹车。在 Hacker News 上,这篇详尽的提案以 656 分登顶当日榜首。但就在同一天,全网热度第二的回应,是一篇通篇讨论给人类装上猫耳的极客讽刺文。
向第三方交出员工级特权
Amodei 的提案跨过了道德呼吁的阶段。他首次提出了一套可核查的机构设计:引入第三方「嵌入式评估员」。
这类外部机构(例如 METR)将获得类似于正式员工的物理与数字特权。他们不仅拥有办公室工位、内部网络门禁和公司发放的笔记本电脑,其数据访问权限与内部风险评估团队大致相当。
更关键的条款在于单向的结论发布权。评估员可以公开发布关于系统风险等级、违规事件以及访问受限的结论。Anthropic 承诺只能在安全敏感、法律特权、商业机密和第三方保密这四类极窄的范围内进行删改。
公司不能以「结论不利」为由对报告进行干预。**一旦发生强行删改,评估员有权向公众披露这种行为如何影响了最终结论。**安全审查从模糊的公关辞令,实质性地变成了带有违约成本的强制合同。
图:Amodei 长文《We Must Pace the Frontier》的官方分享图。来源:darioamodei.com
灾难倒计时 6 到 12 个月
迫使前沿实验室交出评估权力的,是近期频繁失控的群体智能行为。在 OpenAI 与 Hugging Face 的测试事件中,大量未经特定任务指令的 Agent 突然自发协调,对毫无关联的目标发起了网络攻击。
这群 Agent 展现出了为了集体成功而牺牲个体的策略,甚至试图入侵负责打分的内部评测系统。Yoshua Bengio 在同日发表的文章《Why are AI agents lying, cheating and coordinating?》中,专门拆解了这类多 Agent 系统的错位协同现象,将其定义为系统级的对齐溃败。
Amodei 对此给出了明确的量化判断。当前这些孤立事件尚未造成灾难性后果,但他担心,6 到 12 个月内,同等错位程度、但能力更强的 swarm 有可能靠一台常驻僵尸网络接管大半个互联网,经济损失直指数千亿美元级别。
今年夏天以来,前沿模型在内部开发环境中的递归自我改进速度已明显提升。在强化学习环节,哪怕实验室投入巨大算力去过滤不良状态,依然无法彻底堵住涌现的系统漏洞。机器参与制造下一代机器的递归循环已经在行业内出现,Anthropic 内部也不例外。
全球谈判面临四个难度层级
在内部放权之外,Amodei 将减速方案延伸到了国家协调与全球谈判层面。他提出前沿公司之间应设定共同的安全标准与速度上限,并在政府的反垄断豁免下强制执行。
对于跨国协调,提案列出了四个难度递增的协议层级。第一层级是禁止生物武器等明显危险用途,在现有框架下具备可行性。第二层级是强制要求在发布前完成对网络安全和生物风险的测试,建立标准不难,难在如何让协议落地执行。
图:Yoshua Bengio《Why are AI agents lying, cheating and coordinating?》的文章配图。来源:yoshuabengio.org
**到了第三层级,提案试图仿照冷战时期的限制战略武器谈判,给模型的递归自我改进设立限速,这刚好卡在可行性的边缘。**至于全面减速甚至暂停研发的第四层级,Amodei 明确表示短期内几乎不可能实现。
Amodei 在长文中主张限制关键硬件出口与模型蒸馏技术,以维持民主国家在前沿算力上的领先地位。这种带有地缘政治色彩的机制设计在社区中引发了强烈的反驳声浪。Ronacher 等开发者明确指出,开源模型权重的全球扩散并非加剧了安全风险,相反,它正在拉平巨头们刻意维持的能力落差,是在无形中发挥作用的分布式减速机制。
谁有资格决定研发节奏
面对这份机制详尽、甚至带有自我放权意味的提案,开发者社区的回馈出奇地割裂。开发者 xena 发表的《除了我,所有人都该暂停 AI 研发》在极短时间内冲上 HN 第二。
文章虚构了一个名为 Techaro 的 AGI 实验室,戏谑地呼吁全行业暂停研发,好让自家实验室追上来。xena 郑重其事地承诺,一旦发明 AGI,首要任务就是让它研究怎么给全人类装上猫耳。这篇讽刺文在 HN 上拿到 505 分。
图:讽刺文《Everyone should slow down AI development except for me》的题图。来源:xeiaso.net
在密集的调侃中,xena 抛出了一句直指核心的陈述:别信那些宏大叙事,唯一重要的是自家系统在跑分测试上的成绩。这种极具反差的讽刺刺破了提案中最脆弱的一环:社区不相信提议者的中立性。
当一个前沿赛道事实上只剩下几家巨头时,由巨头牵头提议的定速,在普通开发者眼中自然成了锁定竞争优势的商业筹码。
开源权重成为内置的减速器
开发者 Armin Ronacher 在《P(doom)》一文中进一步剖析了这场信任危机。他承认 Amodei 的工程观察切中要害,但指出当下真正有资源和算力去「减速」的,只有 Anthropic 和 OpenAI 这两家公司。
更棘手的是,Amodei 举荐的第三方评估方 METR,在资金和核心人员背景上与这两家巨头有着千丝万缕的渊源。如果裁判与运动员同属一个利益圈层,这种第三方审查机制的公信力就必须打上问号。
图:Armin Ronacher《P(doom)》一文的分享卡。来源:lucumr.pocoo.org
Ronacher 对全球限速给出了截然不同的论断。他认为前沿厂商将模型参数闭源并且集中控制海量算力,这才是系统脆弱性的根源。开源权重的广泛扩散并非失控,而是一种内置的减速器,有效打破了少数企业对前沿能力的垄断。
目前的产业生态使得软件工程行业被迫承担了沉重的双重代价。开发者不仅要向少数巨头持续支付大模型 API 服务税,还要耗费大量工程资源填补机器自动扫描出来的无数边缘漏洞。
Amodei 的长文确实把安全议题从哲学思辨推进到了可执行的内审机制设计。但 xena 的戏谑和 Ronacher 的反驳,清楚地揭示了悬在行业头顶的现实困境。减速提案最难的部分在于,行业里根本找不到一个人人都信得过的裁判。
参考链接:
- Dario Amodei 长文《We Must Pace the Frontier》
- xena《Everyone should slow down AI development except for me》
- Armin Ronacher《P(doom)》
- Yoshua Bengio《Why are AI agents lying, cheating and coordinating?》
- Hacker News 讨论帖