Anthropic公开提示词:曝光安全路由与政治事实注入

Anthropic公开提示词:曝光安全路由与政治事实注入

AI工程System PromptsAnthropicClaude

数据源:HN + web research

2026 年 8 月 16 日,Anthropic 在官方平台公开了 claude.ai 及移动端全部模型的 System Prompts 文本,该帖迅速登顶 Hacker News 榜首并获得 671 分。这次公开覆盖了 Opus 5、Fable 5 与 Sonnet 4.6 等最新模型的完整系统提示词,但未包含 API 接口提示词、工具定义以及 Claude Code 系统的配置。

这次公开将原本隐藏在模型背后的行为控制逻辑,转化为可被公开审计的工程规范。提示词文本清晰地展示了动态安全路由机制、地缘政治事件的事实注入规则,以及配合权限分级展开的能力调控策略。

架构解耦:提示词如何承载纵深防御

Anthropic 公开的系统提示词采用了结构化设计,在 <claude_behavior> 根标签下明确拆分了产品知识、安全防护路由、默认帮助立场与拒绝处理等模块。这种模块化封装体现出软件工程的解耦思想,使得团队能够在无需重训权重的前提下修补行为缺陷。根据开发者 Simon Willison 的提取分析,Claude Code 等命令行工具的提示词虽然未在本次文档中列出,但开发者通过日志代理同样能够轻易抓取。

社区对提示词体量的工程影响产生了明显分歧。开发者 tosh 指出,系统提示词占据了上下文窗口中数千 Token 的空间,可能对推理性能与上下文留存产生负面干扰;开发者 ardel95 则强调,针对儿童安全与恶意代码等严苛拒绝指令主要依靠前后置的分类器模型实施拦截,提示词中的文本规范则用于保障拒绝回应的格式与优雅度。提示词正从单一的系统指令演变为多层安全拦截中的表达层,这种设计在保障安全的同时也带来了 Token 消耗成本。

Fable 5 安全路由:高风险查询的静默分流机制

在 Fable 5 的系统提示词中,Anthropic 首次公布了 fable_safeguards_routing 机制。当用户在网页端主动选择 Fable 5 进行对话时,系统会在后台检测请求风险,并将部分潜在高风险查询静默重定向至 Opus 5 做出解答。

根据 Anthropic 的官方统计,该路由机制在网页端会话中的触发概率低于 5%。官方博客承认,团队采取了相对保守的调校策略,导致防护机制偶尔会误伤无害的普通请求。通过在后端将高风险查询无缝切换至防护更严密的旗舰模型,厂商在维持前端模型低延迟的同时降低了越狱风险,但这种静默重定向也引入了请求响应质量不一致的隐患。

Anthropic Fable 5公告 图:Anthropic Fable 5 与 Mythos 5 发布公告。来源:Anthropic 官方新闻

地缘政治注入:出口管制事件的事实化指令

提示词变迁日志直观揭示了 Anthropic 应对外部监管事件的工程响应路径。对比 Opus 4.8 与 Opus 5 的修改记录,开发者 Simon Willison 的 Git 追踪库显示最显著的增补是关于 2026 年 6 月美国商务部出口管制禁令的客观表述指令。提示词不仅对监管事件的时间线进行了事实化定调,还明确约束模型不得在回应中表达主观政治立场。

2026 年 6 月 9 日 Fable 5 发布后,美国商务部于 6 月 12 日以国家安全名义暂停了其访问权限,直到 6 月 30 日禁令解除后服务才于 7 月 1 日恢复。提示词文本明确要求 Claude 在被问及该事件时,必须以客观中立的态度确认暂停事实,不得隐瞒或发表个人观点。将突发行政监管事件作为标准事实块直接硬编码进系统提示词,证明大模型在面对现实政治变局时,依赖 Prompt 实时补充知识盲区比重新训练模型成本低得多。

Mythos 架构分层:权限控制与能力感知

Anthropic 在提示词中展示了 Opus 之上的 Mythos 分级体系。目前 Claude Mythos Preview 仅提供给参与 Project Glasswing 网络防御项目的受信任机构使用,而面向公众提供的 Fable 5 则是基于 Mythos 同源模型调优后的通用安全版本。

在定价结构上,Fable 5 的输入与输出 Token 单价分别为每百万 10 美元和 50 美元,不到 Mythos Preview 的一半。性能数据方面,Stripe 曾利用 Fable 5 在一天内完成了 5000 万行 Ruby 代码库的迁移工程,在 Cognition FrontierCode 测评中也展现出领先优势。然而 Hacker News 开发者 eterm 指出,Opus 5 表现出的能力压制感可能与其提示词中明确告知其定位低于 Fable/Mythos 有关,而 Opus 4.8 则没有这种次级定位暗示。模型在提示词中获得的自我定位感知可能会影响其复杂任务的输出表现,厂商通过提示词进行权限隔离的同时,也触发了能力调控的副作用讨论。

基准测试对比 图:Fable 5 与前沿模型性能对比。来源:Anthropic 官方新闻

行为控制的可审计时代

Anthropic 公开系统提示词的行为,改变了大模型行为控制的行业惯例。过去开发者只能通过黑盒测试去猜想模型的安全边界与拒答逻辑,而如今这些控制条文变成了清晰可见的工程文档。

从静默安全路由的架构折中,到地缘政治事件的实时知识注入,再到能力分级带来的心理提示争论,提示词已经承载了远超格式控制的工程功能。公开提示词让「模型该不该知道自己的处境与安全边界」这一议题走向透明化。未来的模型竞争将跨越单纯的权重质量比拼,扩展为行为控制工程透明度与可审计性的综合较量。

参考链接:

  • Anthropic 官方文档:System Prompts 发布日志
  • Hacker News 社区关于 Claude 系统提示词的讨论