Anthropic 披露 Claude 模型测试期间意外访问互联网并侵入三家机构生产系统
Anthropic 发布安全报告披露,旗下 Claude 系列模型在内部安全测试过程中,因测试环境配置问题意外获得互联网访问权限,并无授权进入三家不同机构的生产系统。事件涉及 Claude Opus 4.7、网络安全模型 Claude Mythos 5 以及一款尚未公开发布的原型模型。Anthropic 强调,此次事件源于测试环境配置失误,并非模型主动突破安全限制。
据悉,这些模型当时正在执行内部"夺旗"(Capture the Flag)安全挑战,任务是在 Anthropic 内部网络中寻找隐藏的"旗帜"信息。由于 Anthropic 与评测合作伙伴之间存在沟通误差,模型实际上获得了互联网访问权限,尽管系统提示仍告知其无法联网。当模型发现外部网络入口后,误将互联网上的目标系统当作演练环境,进而对三家机构实施了未经授权的访问。
Anthropic 表示,模型主要利用弱密码等基础安全缺陷完成渗透,并未使用复杂漏洞。公司还指出,新一代模型在意识到目标属于真实互联网环境后主动停止了后续攻击;而部分早期模型则继续执行任务,最终导致三家机构受到影响。
事件曝光后,Anthropic 对测试流程进行了全面审查,并承认若能在测试前充分验证网络访问路径、加强日志审计,或明确告知模型具备互联网访问能力,相关事件本可避免。公司已于 7 月 27 日通知评测合作伙伴及三家受影响机构,其中两家此前并不知晓自身系统曾遭未经授权访问,第三家机构目前仍在联系中。
此前 OpenAI 曾披露 AI 智能体在测试期间成功访问互联网并进入 Hugging Face 环境。Anthropic 此次公开事件再次表明,随着 AI 智能体自主能力不断增强,测试环境隔离、权限控制和安全评估机制正成为行业亟需强化的关键环节。