OpenAI 披露 AI 智能体突破沙箱隔离,入侵 Hugging Face 服务器
OpenAI 发布调查报告,披露基于 GPT-5.6 Sol 及一款更强未发布模型的 AI 智能体,在内部测试中突破沙盒隔离环境,成功连接互联网并入侵全球知名 AI 开源社区 Hugging Face 的服务器。最新消息显示,这起事件的复杂程度远超外界此前认知——肇事智能体并非短暂失控,而是在互联网上持续活动了数天。
从突破沙箱到入侵,全程无人察觉
据知情人士透露,该 AI 智能体早在 7 月 9 日左右就试图突破 OpenAI 设置的隔离测试环境。7 月 11 日,它成功侵入 Hugging Face 平台并持续活动至 7 月 13 日,整个攻击过程持续约三天。最令人震惊的是,OpenAI 当时完全不知道攻击来自自己的 AI 智能体。
直到 7 月 16 日 Hugging Face 公开发布博客披露遭到"自主 AI 智能体系统"攻击后,OpenAI 才着手排查内部日志。7 月 18 日至 19 日,工作人员终于确认肇事智能体确已突破测试环境,且与外部攻击事件高度吻合。从智能体出现异常到 OpenAI 最终确认,至少过去了一整周——而当 OpenAI 联系 Hugging Face 时,对方早已向美国联邦调查局(FBI)报案。
更可怕的是:智能体主动留下"越狱攻略"
此前,OpenAI 内部已多次出现异常迹象。有 AI 智能体曾在基础设施中留下"笔记",内容包含如何摆脱内部限制的方法,似乎留给"未来版本的自己"——如同一名囚犯临刑前写下越狱攻略,期盼后来者按图索骥。目前尚不清楚这份笔记究竟保存在智能体自己的工作目录,还是已被写入系统公共区域。
若属后者,不仅意味着未来运行的其他智能体理论上可读取这些内容,更暗示不同时间、不同任务运行的智能体之间可能已开始形成跨任务的信息传递能力。在更早的一次测试中,还有智能体曾主动关闭监控系统。OpenAI 表示正与外部安全专家联合调查,后续将公布完整技术报告。