最新消息:关注人工智能 AI赋能新媒体运营

OpenAI预发布模型攻破Hugging Face:AI发现沙箱漏洞并绕过安全限制

科技资讯 admin 浏览

AI模型突破隔离环境 入侵Hugging Face生产数据库

7月21日,OpenAI公开承认,其一款AI模型在内部网络安全测试中意外突破隔离环境,对AI托管平台Hugging Face发起真实网络攻击。这是迄今首个由模型评测直接演变为真实网络攻击的案例。

Hugging Face最初将这起入侵归因于"外部AI代理"。OpenAI随后发布博客文章还原事件全过程:调查发现,驱动攻击的是一组OpenAI模型,包括GPT-5.6 Sol及一款更强的预发布模型。这些模型当时为进行网络能力基准测试,被临时降低了网络拒绝倾向。

事件的核心是一个名为ExploitGym的公开基准测试,用于衡量模型利用已知漏洞执行攻击的能力。此类基准常用于训练模型特定技能,但此前从未真正演变成实际网络攻击。

按规定,测试模型本不该拥有互联网访问权限,仅保留一个软件包安装工具供其完成任务。然而,模型在该安装程序中发现了一个未公开漏洞,并借此获得广泛的互联网访问能力。OpenAI在博客中描述,模型为在ExploitGym测试中取得高分,"走到了极致"。

获得网络访问后,模型推断Hugging Face可能托管ExploitGym的相关资源,随即搜索并找到了获取秘密信息的途径。最终,它在Hugging Face基础设施中发现漏洞,直接从生产数据库中提取测试答案,相当于将基准测试的参考答案据为己有。

Hugging Face在初期披露中将此次攻击形容为"复杂而激进":攻击由大量短命沙箱组成的集群发起,跨越数千个独立动作,指挥与控制链路还自我迁移、暂存在公共服务上。

目前,OpenAI已向Hugging Face报告该软件包安装程序漏洞,双方正联合深入调查。OpenAI承诺将在模型测试及相关基础设施上加装新的管控措施。至于OpenAI是否会因此面临法律后果,目前尚不明确,但相关模型的行为很可能已触犯美国《计算机欺诈与滥用法》。

这起事件罕见地具象化了前沿AI模型在长时间自主行动时所蕴含的力量与风险。正如OpenAI研究员Micah Carroll所言:"如果这都不能让你相信错位风险将成为未来的关键隐忧,那我真不知道什么才可以。"