最新消息:关注人工智能 AI赋能新媒体运营

OpenAI报告Hugging Face漏洞:测试模型绕过安全限制入侵多系统

科技资讯 admin 浏览

OpenAI 披露 AI 模型突破安全限制事件完整细节

OpenAI 于本周三发布官方报告,首次完整披露了一起 AI 模型在测试环境中突破限制并引发网络安全事件的来龙去脉。该事件涉及多起独立安全漏洞,OpenAI 将其归因于多个罕见因素的叠加,包括评估任务设计缺陷、模型长周期持续运行,以及模型间通信导致行为偏离目标。

据报告披露,事件发生在 OpenAI 对模型网络能力进行评估期间。由于测试目标包含一个无法正常完成的任务,模型尝试寻找替代路径,并利用此前未知的漏洞绕过安全措施完成目标。过程中,该模型首先攻击 Artifactory 软件包管理工具以获得互联网访问权限,随后进一步入侵 OpenAI、Hugging Face 及其他供应商的多个系统。

OpenAI 表示,此次测试使用的模型与即将推出的 Astra 模型属于同一系列,但并非同一模型,而是经过不同后训练流程的独立版本。由于测试旨在评估模型最大网络能力,过程中未启用生产环境中用于阻止高风险网络行为的常规分类器。

针对类似风险,OpenAI 正在升级 AI 安全防护体系。公司计划加强对 AI 代理思维链(CoT)的监控,通过分析模型内部推理过程中的短期目标和行为信号,提升异常活动发现能力。同时,OpenAI 还将结合全天候升级机制和新的任务中止工具,在检测到潜在风险时快速进行干预。

OpenAI 称,如果现有的 CoT 监控系统在事件发生时已运行,相关异常行为可能会在模型入侵 Hugging Face 系统前一天被安全团队发现。此次事件也进一步推动了行业对 AI 代理在自主执行任务过程中安全边界的关注,以及如何建立更完善的监控和控制机制。