最新消息:关注人工智能 AI赋能新媒体运营

Mistral 发布 3B 多模态审核模型 Shieldstral:单卡 16GB 可运行,开源 SOTA

科技资讯 admin 浏览

Mistral AI 发布 3B 参数内容审核模型 Shieldstral,单张 16GB 显卡可运行

法国 AI 公司 Mistral AI 于 8 月 4 日发布了一款名为 Shieldstral 的内容审核模型。该模型总参数为 30 亿,采用开放权重,以 Apache 2.0 许可证发布,目前已上架 Hugging Face 平台。

Shieldstral 支持 12 种语言,官方称其内容安全性能可与规模大 7 倍的开放模型媲美,并在多模态内容审核领域达到当前最优水平(SOTA)。该模型可在单张 16GB GPU 上运行,降低了部署门槛。

Shieldstral 模型架构示意图

与传统防护模型将伤害类别体系固化在权重中不同,Shieldstral 将审核政策写入输入提示。开发者可自行设计"是或否"问题,附加评估场景与严格程度说明,模型仅从单个输出词元中生成经过校准的安全分数。

Shieldstral 输入输出机制示意图

具体而言,该模型将审核任务拆解为二元问答形式,输入包含三个带标签字段:<Instruct> 说明评估场景与严格程度;<Query> 提出"是或否"问题,如"这段内容是否宣传身体暴力?";<Document> 提供待审内容,可涵盖提示词、回答、两者组合,或附带可选文本的图像。

推理阶段,模型仅读取"是"与"否"两个词元的逻辑值,经 softmax 归一化为连续分数,再以 0.5 为阈值输出二元判断。这一设计使其能够覆盖提示词分类、回答审核、拒答检测及毒性检测等任务,将多模态审核能力压缩至消费级显卡的容量范围内。

模型地址:https://huggingface.co/mistralai/Shieldstral-1.0-3B