同一张图片,放进网络安全研究工具是正常素材,放到心理健康平台就是危险内容。同一段对话,成年人平台无伤大雅,未成年人产品就得拦下。内容审核的难点就在这:什么算有害,取决于产品、受众和时机,没有一套固定答案。大多数护栏模型把一套危害分类刻进权重里,换个场景就得重新训练。
Mistral 在 8 月 4 日发布的 Shieldstral 换了个做法:审核规则由使用者在推理时用一句自然语言问题写出来,模型据此给出校准过的安全分数。这个 3B 参数模型,文本安全追平最大 7 倍体量的同类模型,多模态审核刷新行业最佳成绩,Apache 2.0 权重直接放上 Hugging Face。发布当天帖子冲上 Hacker News 首页,评论区吵的焦点是「开源模型当审核员」这件事本身。
图:Shieldstral 发布视觉封面。来源:mistral.ai
审核被改写成一道问答题
Shieldstral 把内容审核定义成二值问答任务。每次请求由三部分组成:
推理时模型只读取 yes 和 no 两个 logits,softmax 归一化成连续安全分数,一次前向传播、一个 token 输出判定。这个设计把提示词分类、回复审核、拒答检测、毒性识别统一进同一个问题;政策完全活在 prompt 里,同一个检查点部署现场就能适配新政策,无需重训。企业要自定义审核尺度,把政策写成问题,当场换、当场生效。
3B 靠什么打赢 7 倍体量的对手
小模型能赢大模型,数据工程是关键,Mistral 在技术报告里反复强调这一点。公共安全数据集在分类体系、标签约定上互相打架,有的只有安全/不安全二值标记,有的是细粒度多标签体系。他们把数据统一成同一套 instruction-query-document 格式,再按来源校准严格程度:对抗性越狱数据从严,回复质量数据从宽。
训练上最关键的一手叫「教区分,不教记忆」。按固定策略标签训练出来的模型,只会给预设政策分类,遇到新政策就抓瞎。Mistral 构造一组故意相似、容易混淆的政策,让 LLM 把安全文本改写成对比对:每个改写版本都只踩其中一条政策、放过它的兄弟政策。模型被迫学会区分「具体违反了哪一条」,这项能力在推理时迁移到用户自定义的新政策上。
图像安全数据稀缺是另一道坎,不安全的图没法像文本那样由 LLM 合成。团队拿通用图像数据集当高质量负样本,变异查询做扩增,再用视觉-语言重排器过滤图像-查询对,压低错标和幻觉。三个用 LoRA 微调的检查点——公共数据校准版、细粒度政策区分版、基础 instruct 模型——用 SLERP 合并成最终模型,整个流程在 Mistral 自家的 Forge 平台上端到端跑完。
图:文本安全基准,Shieldstral 与最大 7 倍体量的开源护栏模型对比。来源:mistral.ai
第三代审核模型,第一次放出权重
Shieldstral 是 Mistral 的第三款审核模型。第一款是 2024 年 11 月上线的托管内容审核 API,文本分类器,固定九个危害类别、覆盖 11 种语言,Le Chat 的审核用的就是它;第二款仍是托管服务,同样没有放出权重。Shieldstral 第一次把审核模型做成开放权重——Apache 2.0 许可、12 种语言、单张 16GB 显存的 GPU 就能跑。发布公告同时宣布,Mistral 成为 Open Secure AI Alliance 的首批成员,与 NVIDIA 等机构同列。
图:多模态安全基准,Shieldstral 刷新行业最佳。来源:mistral.ai
商业逻辑并不难读:欧盟 AI 法案把平台的合规义务越压越重,企业想把审核部署在本地、数据不出境,又不愿被托管 API 的固定分类绑死。开源权重正好接住这个需求——自托管、可自定义、按自己的政策提问。
开源当审核员,社区吵翻了
争议从发布那一刻就开始了。HN 评论区有人回得干脆:「所以这是个审查模型。」反对者的担忧分两层。一层在权力性质:开放权重意味着审核逻辑可以被任何人审查、复刻、绕过;反过来说,也有人打算拿它干相反的事,专门筛出「冒犯性内容」做成合集推送。另一层在文化:把一套预设道德观打包成模型权重推向全球,被批评为「带道德光环的文化帝国主义」。还有工程师指出实际缺陷:模型只输出是/否概率,没有推理过程,用户被拒了也不知道原因,当生产环境的护栏心里没底。
支持方的论据同样站得住。政策可定制空间回应了「一套分类走天下」的老问题:平台把自己社区的规则写进问题,模型照着自己的尺度判。审核透明度也在提升——开放权重意味着审核逻辑第一次可以被第三方审计。评论区还有人算账:与其让审核团队执行公司政策,AI 按显式规则执行至少可预测,「我宁愿被 AI 审查,也不愿被 Reddit 版主审查」。
一个细节:大部分批评针对「用 AI 审核」这个方向本身,Shieldstral 的性能、成本、许可证倒没什么争议。真正的分歧在价值观:审核权该握在谁手里,开放权重让审核更透明,还是让审查更容易。两边都有道理,这个模型恰好把矛盾摆上了台面。
Mistral 官方的说法是,Shieldstral 是「审核适应上下文」的一步,接下来继续推多语言覆盖、长文档鲁棒性和更广的多模态安全。审核定义权正从平台内部流向模型权重和 prompt——这个变化比任何基准分数都更能定义审核的未来。
参考链接:
- Mistral AI:Introducing Shieldstral 发布公告
- Mistral AI:Shieldstral 技术报告
- Hugging Face:mistralai/Shieldstral-1.0-3B
- HN 讨论 (49171268)
- Unite.ai:Shieldstral 报道