Mistral 开源 Shieldstral:30 亿参数内容安全模型
Apache-2.0 许可,推理时以自然语言提问的方式接收审核策略,单张 16GB 显卡即可跑起来。
策略写在推理里,不写进权重
Mistral 于 8 月 4 日发布 Shieldstral,一个 30 亿参数的内容安全模型,采用 Apache 2.0 许可,同时公开了技术报告。它的思路与常见的护栏模型不同:不再依赖训练阶段固化的风险类目表,而是把审核当成一个二元问答任务——部署方在推理时用自然语言把策略写成一个问题,模型返回一个校准过的分数,文本与图像走同一个接口。
这个改动是关键。传统护栏分类器逼着使用方要么接受厂商给定的类目,要么每次策略变动都重新微调一版模型;而电商平台、儿童产品和医疗服务需要划的红线本来就不一样。Shieldstral 把这个决定挪进了提示词,改策略从此是改一段文字,而不是跑一次训练。
体量与官方给出的成绩
Mistral 称该模型在文本安全、拒答识别、策略适配性和多模态安全等评测上,达到或超过体量最多为其 7 倍的开源护栏模型,并在多模态审核上取得 SOTA。30 亿参数意味着它能跑在单张 16GB 英伟达显卡上,既可用于端侧和边缘部署,也可作为托管模型前置的实时过滤层。
影响
审核环节是大量已上线 AI 产品悄悄翻车的地方:过严则产品不可用,过松则埋下责任风险,而同一套过滤器往往两头都顾不上。一个小体量、宽松许可、可在运行时配置的分类器,降低了把这层做对的成本——尤其是对养不起自研安全栈的中小团队。许可证的意义甚至不亚于跑分:Apache 2.0 意味着企业可以把过滤器完全私有化部署在自己的边界内,这对面临《AI 法案》透明度与内容义务的欧洲运营方、以及任何不能把用户内容送去第三方审核 API 的团队都直接相关。它同时延续了一个趋势:被开放出来的不只有前沿能力,还有安全工具本身。