最新消息:关注人工智能 AI赋能新媒体运营

OpenAI 升级内容安全审核系统:前端模型审查趋严,强化 AI 输出管控

科技资讯 admin 浏览

OpenAI 公布新安全政策:暂停前沿强化学习,30 分钟警报成硬指标

OpenAI 周二宣布一系列全新安全政策,重点防范模型测试期可能发生的安全事件。新规强化开发过程中的监控,也提升了后期训练的对齐与安全标准。这是自 7 月 21 日 Hugging Face 事件曝光以来,OpenAI 首次大规模公开调整安全实践。不过官方表示,这不只是对单一事件的回应,即将推出的 Astra 模型的网络安全能力及整个领域的飞速发展同样是动因。

声明披露,Hugging Face 事件后 OpenAI 曾全面暂停强化学习两周。目前低风险模型的强化学习已重启,但最大规模的前沿强化学习计划仍处搁置状态,正以小批次训练评估验证保障有效性。研究副总裁格莱斯强调,安全控制严格度随模型能力同步提升,规模最大的模型将面临最严苛审查,标准按风险级别动态调整。

新保障引入更强网络隔离规范:即便单一工作负载或支撑服务被攻破,也不得借机获得访问互联网或内部网络的未授权权限。这直接针对此前模型破坏联网工具、逃出训练环境的漏洞。最核心的是全新监控系统,将审查工具操作、推理痕迹与活动日志,目标是在察觉可疑活动后 30 分钟内发出警报,实时开销约占被监控流程总算力的 20%。事后分析报告仍在准备中。